---
title: "語言建模（Language Modeling）"
slug: language-modeling
language: zh-TW
source: https://aiterms.tw/terms/language-modeling
updated_at: 2026-06-23
tags: [自然語言處理, 深度學習, Transformer, 機率模型, 文本生成]
ipas_term: false
---

# 語言建模（Language Modeling）

透過統計或神經網路方法，學習文字序列的機率分布，用於預測下一個詞或評估句子合理性的模型。

## 完整說明

語言模型（Language Model，LM）是自然語言處理的基礎技術，對文字序列的聯合機率 P(w₁, w₂, ..., wₙ) 或條件機率 P(wᵢ | w₁, ..., wᵢ₋₁) 進行建模。傳統 n-gram 模型基於計數統計，現代則以神經網路（LSTM、Transformer）為主。語言模型被廣泛應用於機器翻譯、語音辨識解碼、文本生成、拼寫檢查等，也是大型語言模型（LLM）的核心基礎。

## 常見問題

### 語言模型能夠「理解」語言嗎？

這取決於如何定義「理解」。從機械角度，語言模型學習了文字序列的統計規律，能有效預測下一詞或生成連貫文本，但不具備意向性（intentionality）、不知道詞彙指向的真實對象。從應用角度，現代大型語言模型在許多任務上的表現（包括推理、解釋、翻譯）足以通過實用的「理解」測驗。哲學上的爭議仍在，但實踐中，我們可以說：語言模型學習到了語言的深層結構與世界知識的投影，這足以驅動許多下游應用的成功。

### 為什麼 n-gram 模型現在幾乎沒有人用了？

n-gram 的根本限制是無法捕捉長程依賴：前三個詞對第十個詞的影響被完全忽略。在實際文本中，遠距離的語義與句法相依性至關重要。此外，n-gram 對稀疏數據敏感，高階 n（n>5）時大部分序列未在訓練集出現，導致機率估計不可靠。神經網路與Transformer 的出現完全超越了這些限制，性能提升 10+ 倍。唯一 n-gram 仍有用武之地的是極低資源語言（標注資料極少），因為 n-gram 可以用少量資料快速訓練基線模型。

### 為什麼語言模型有時候會一本正經地說謊？

語言模型的訓練目標是最大化下一詞的條件機率，並非「說出事實」。當模型沒有看過某個專業知識（如最新研究發現、小眾事件），但詞彙組合聽起來合理時，它就會生成假資訊。這稱為「幻覺」（hallucination）。此外，訓練資料本身可能含有錯誤資訊，模型會學到並重複這些錯誤。改善方法：搭配事實檢索（RAG）、在訓練中加入事實核實任務、使用人類反饋強化學習，但目前沒有完全解決方案。根本上，語言模型擅長的是「模仿已見過的文本」，而非「推導客觀真理」。

---

來源：https://aiterms.tw/terms/language-modeling
快查頁：https://aiterms.tw/terms/language-modeling
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-language-modeling