AI 主題集合

自然語言處理 術語大全

完整收錄 241 個 自然語言處理 相關 AI 術語,每個術語提供中英文定義、深度解說與 iPAS 考試重點分析。

樸素貝氏(Naive Bayes)

樸素貝氏分類器是一種基於貝氏定理的簡單機率分類器。它假設所有特徵之間相互獨立,簡化了計算複雜度,因此得名「樸素」。常用於文本分類等任務。

查看術語

影像描述生成(Image Captioning)

影像描述生成(Image Captioning)是電腦視覺與自然語言處理的交叉任務,旨在讓模型自動為輸入影像產生自然語言描述,是多模態 AI 的核心應用之一,評估指標常用 BLEU、CIDEr、SPI

查看術語

LangChain框架(LangChain)

LangChain是一個用於開發基於大型語言模型(LLM)應用程式的框架。它簡化了LLM的整合、鏈接和部署,讓開發者能快速構建複雜的AI應用。

查看術語

KL散度(KL Divergence)

KL散度(Kullback-Leibler Divergence)衡量兩個機率分佈的差異,數值越大代表分佈差異越大,常用於評估模型預測分佈與真實分佈的接近程度。

查看術語

巢狀欄位(Nested Field)

巢狀欄位是一種資料結構,指一個欄位內部包含其他子欄位,形成階層關係,常用於表示複雜或半結構化資料,提升資料組織與查詢效率。

查看術語

文字生成音訊(Text-to-Audio)

文字生成音訊(Text-to-Audio)是把一段文字描述直接轉成聲音的生成式 AI 技術,產出的是音樂、音效或環境音,不是唸稿的人聲。它跟文字轉語音(Text-to-Speech)最大的差別,在於生成的是整個聲音場景,還是單純的說話聲。

查看術語

BM25算法(BM25)

BM25 (Best Matching 25) 是一種用於資訊檢索的排序函數,它基於詞頻和逆文檔頻率,並考慮了文檔長度的影響,以提高檢索的準確性。

查看術語

前綴調整法(Prefix Tuning)

前綴調整法是一種參數高效的微調技術,通過在輸入序列前添加可訓練的前綴向量,來引導預訓練模型生成期望的輸出,同時保持原始模型參數凍結。

查看術語

聊天機器人(Chatbot)

聊天機器人是一種能模擬人類對話的電腦程式,透過文字或語音與使用者互動,提供資訊、協助解決問題或執行特定任務。

查看術語

語料庫(Corpus)

語料庫是大量結構化的文本集合,用於語言研究和自然語言處理,提供真實語言使用的範例,用於訓練和評估模型。

查看術語

知識圖譜(Knowledge Graph)

知識圖譜(Knowledge Graph)是以圖結構儲存實體(Entity)及其關係(Relation)的語意知識庫,透過「主體-關係-客體」三元組表示現實世界的知識,廣泛應用於搜尋引擎增強、問答系統

查看術語

波形網路(WaveNet)

WaveNet是一種深度生成模型,直接對原始音訊波形進行建模,能夠生成高品質的語音和音樂,並在語音合成領域取得了顯著的成果。

查看術語

重排序模型(Reranking)

重排序模型是一種在初步檢索後,對候選結果進行重新排序的技術,旨在提升檢索結果的相關性和準確性,通常使用更複雜的模型。

查看術語

雙向編碼器(Bidirectional Encoder)

能同時處理序列的前向和後向上下文,在每個位置都能看到完整序列信息的神經網路編碼器,相比單向模型提供更豐富的上下文表示,是 BERT 等預訓練模型的核心。

查看術語

推理能力(Reasoning)

推理能力是指AI系統基於已知資訊和規則,進行邏輯推導,得出結論或解決問題的能力。是AI模擬人類智慧的關鍵組成部分。

查看術語

貪婪解碼(Greedy Decoding)

貪婪解碼是一種序列生成方法,在每個時間步選擇概率最高的詞作為輸出,直到生成終止符號或達到最大長度。它簡單快速,但可能陷入局部最佳解。

查看術語

遺忘門(Forget Gate)

長短期記憶網路(LSTM)的核心門機制,通過 sigmoid 激活函數產生 0-1 的控制信號,決定上一時步細胞狀態中有多少信息應被遺棄或保留,是解決梯度消失問題的關鍵元件。

查看術語

BLEU分數(BLEU Score)

BLEU分數是一種評估機器翻譯文本品質的指標,通過比較候選譯文與參考譯文的n-gram重疊程度來計算,數值越高表示翻譯品質越好。

查看術語

低秩適配(LoRA)

LoRA是一種參數高效的微調技術,透過學習低秩矩陣來適應預訓練模型,大幅減少訓練參數,降低計算成本。

查看術語

集束搜尋(Beam Search)

集束搜尋是一種啟發式搜尋演算法,用於序列預測任務,它在每個時間步保留多個最有可能的候選序列(集束),而非僅僅選擇最佳選項。

查看術語

輸入門(Input Gate)

長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。

查看術語

推論(Inference)

推論是指利用已訓練好的機器學習模型,對新的、未曾見過的資料進行預測或判斷的過程。是模型部署後的核心環節。

查看術語

羊駝語言模型(LLaMA)

LLaMA(Large Language Model Meta AI)是 Meta 開發的開放權重(open-weight)大型語言模型系列,可免費下載、修改、自行部署,採 Meta 自訂 community license 授權,非 OSI 認證開源。

查看術語

拉普拉斯平滑(Laplace Smoothing)

拉普拉斯平滑(Laplace Smoothing)又稱加一平滑,是貝氏統計中避免零機率問題的技術,在計算類別條件機率時,將每個類別的計數加上常數 α(通常為 1),防止訓練集未見過的詞彙或特徵使整個機

查看術語

隱藏狀態(Hidden State)

隱藏狀態是神經網路中用於儲存與傳遞歷史資訊的內部記憶向量,負責在處理序列資料時保留上下文特徵,協助模型理解時序依賴關係。

查看術語

文本到文本(T5)

T5 (Text-to-Text Transfer Transformer) 是一種將所有 NLP 任務轉換為文本到文本格式的轉換器模型,簡化了模型訓練和應用。

查看術語

詞向量(Word2Vec)

詞向量(Word2Vec)是一種將詞語轉換為數字向量的技術,其核心概念是讓語意相近的詞彙在向量空間中的距離更接近

查看術語

解碼器(Decoder)

解碼器是神經網路的一部分,負責將編碼器產生的抽象向量表示,轉換成人類可理解的目標輸出,如文字、圖片或語音。

查看術語

分詞(Tokenization)

分詞是自然語言處理(NLP)中的基礎步驟,旨在將連續的文本序列拆解成更小的、具有語義意義的單元,例如詞彙、子詞或字符,這些單元稱為 tokens。

查看術語

適配器模組(Adapter)

適配器模組是一種輕量級的模型微調方法,透過在預訓練模型中插入少量可訓練參數,以適應特定任務,同時保持原始模型參數凍結。

查看術語

符記(Token)

符記是大型語言模型處理文字時,不可分割的最小單位,它可以是一個字、詞,或者更小的子詞

查看術語

曼巴模型(Mamba)

Mamba是一種基於選擇機制的序列模型,旨在解決Transformer在長序列建模上的效率瓶頸,透過硬體感知演算法提升運算速度。

查看術語

詞頻-逆文檔頻率(TF-IDF)

TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性(TF)和全局重要性(IDF)的乘積,評估詞在文檔中的相關性。

查看術語

輸出門(Output Gate)

長短期記憶網路(LSTM)的門控機制之一,通過 sigmoid 激活函數產生 0-1 的信號,決定細胞狀態中有多少信息應被輸出至隱藏狀態,控制網路對外部環境的信息交互程度。

查看術語

自然語言處理 概念比較

常見問題

自然語言處理 是什麼?

本頁依已發布術語的主題標記,整理 241 個 自然語言處理 相關概念。

自然語言處理 有哪些核心術語?

詞義消歧、稀疏注意力機制、多跳推理、語音助理、網路釣魚偵測

自然語言處理 相關術語在 iPAS 考試中重要嗎?

本頁有 41 個術語標記為 iPAS 相關。