---
title: "遮蔽語言模型（Masked Language Model）"
slug: masked-language-model
language: zh-TW
source: https://aiterms.tw/terms/masked-language-model
updated_at: 2026-07-29
tags: [深度學習, 自然語言處理, 自監督學習, 模型訓練, 大型語言模型, AI基礎]
ipas_term: false
---

# 遮蔽語言模型（Masked Language Model）

> **你有沒有做過填空題，少掉幾個字也還是能猜出整句意思？**
> 你可以把遮蔽語言模型想成，先把句子挖空，再讓模型把空格填回來。
> 它其實就是透過預測被遮蔽的詞來學語言。
> 這種方式很適合學上下文和雙向語意。
>
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆
> **MLM vs 因果語言模型**
> MLM 看雙向上下文，因果語言模型通常只看前文。
> 一個像整句填空，一個像接龍。
>
> **MLM vs 完形填空任務**
> 完形填空是題型，MLM 是訓練方法。
> 一個是考試形式，一個是學習方式。
>
> **最關鍵的區別：** 題型和訓練方法不是同一件事。
>
### 記住這句就好
> 先把字挖掉，再逼模型補回來。
>
### 實際案例
> **BERT 預訓練**
> BERT 就常用 MLM 學到雙向上下文，讓它更懂句子語意。
>
> **文字理解模型**
> 當你要做分類或檢索前的表徵學習，MLM 很常是前置訓練任務。
>
### 算法與應用
> 常見做法是隨機遮住部分 token，讓模型根據左右文預測原詞。
> 因為能看左右兩邊，它比單向接龍更擅長理解語境。
> 這也是 BERT 類模型的重要預訓練任務。
>

### 中英對照與常見說法

| 說法 | 出現場合 |
| --- | --- |
| 遮蔽語言模型 | 台灣正式用語 |
| 掩码语言模型 | 簡體寫法 |
| Masked Language Model | 英文原名 |
| MLM | 標準縮寫，注意這個縮寫在商業領域另指多層次傳銷，不同領域同名 |
| 克漏字任務、完形填空 | 用來說明它在做什麼的比喻說法 |

### 跟自回歸語言模型的根本差別

| | 遮蔽語言模型（如 BERT） | 自回歸語言模型（如 GPT 系列） |
| --- | --- | --- |
| 訓練目標 | 蓋住句中部分詞，預測被蓋住的是什麼 | 依前文預測下一個詞 |
| 看得到的上下文 | 左右兩邊都看得到 | 只看得到左邊 |
| 天生擅長 | 理解類任務：分類、抽取、標註 | 生成類任務：寫作、對話、續寫 |
| 直接拿來生成 | 不適合，它沒有逐字往下生成的機制 | 適合 |

> 一句話的區別：一個是**克漏字**，一個是**接龍**。雙向上下文是遮蔽語言模型在理解任務上長期占優的原因，也是它不能直接拿來生成的原因。

### BERT 的遮蔽策略細節

> BERT 隨機挑 15% 的 token 當作預測目標，但這 15% 裡面又分三種處理：
>
> | 比例 | 處理方式 | 理由 |
> | --- | --- | --- |
> | 80% | 換成 [MASK] 特殊符號 | 主要的訓練訊號 |
> | 10% | 換成一個隨機的詞 | 強迫模型對每個位置都保持懷疑，不能只在看到 [MASK] 時才動腦 |
> | 10% | 保持原詞不動 | 讓模型的表示偏向真實輸入的分布 |
>
> 這個設計是為了處理**預訓練與微調的落差**：訓練時句子裡有 [MASK]，實際使用時沒有。後兩種處理就是在縮小這個落差。
>
> 後續改良包括 **全詞遮蔽（whole word masking）**，把同一個詞被切開的多個子詞一起遮住，避免模型靠半個詞猜另外半個；以及 **SpanBERT** 的連續片段遮蔽，讓任務更難也更貼近下游的抽取需求。

### 現在還用得到嗎

> 大型語言模型興起後，生成任務幾乎都用自回歸架構。但遮蔽語言模型在幾個地方仍是首選：**需要句向量的場景**（檢索、相似度比對，BERT 系列的雙向表示品質好且模型小）、**序列標註**（命名實體識別、詞性標註）、以及**延遲與成本敏感的線上分類服務**。一個幾億參數的編碼器模型能在毫秒級完成分類，這是大型語言模型做不到的。

### 情境判斷
> **Q1（直覺題）： 句子中間少掉一個詞，模型要根據前後文猜回來，這像什麼任務？**
>
> → 這就是遮蔽語言模型的典型訓練方式。
>
> **Q2（判斷題）： 只要是填空題，就一定代表模型用了 MLM 嗎？**
>
> → 不一定，填空是題型，MLM 是一種訓練策略。
>
### 常見問題
> **Q：MLM 為什麼能學雙向語意？**
> 因為它在預測空格時可以同時看左邊和右邊的上下文。
>
> **Q：MLM 一定要遮很多字嗎？**
> 不一定，遮太多會太難，遮太少又學不到足夠上下文。
>
> **Q：MLM 和 BERT 有什麼關係？**
> BERT 最經典的預訓練方式之一就是 MLM。
>
### 相關術語
> - **BERT**：這是 MLM 最常一起出現的模型。
> - **完形填空任務**：讀完這個，能更快理解 MLM 在做什麼。
> - **因果語言模型**：兩者是最常被拿來對比的語言模型訓練法。
> - **轉換器架構**：很多 MLM 模型都是建立在這個架構上。

---

來源：https://aiterms.tw/terms/masked-language-model
快查頁：https://aiterms.tw/terms/masked-language-model
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-masked-language-model