---
title: "遮罩語言模型預測（MLM）（Masked Language Modeling）"
slug: masked-language-modeling
language: zh-TW
source: https://aiterms.tw/terms/masked-language-modeling
updated_at: 2026-06-22
tags: [BERT, 預訓練, 自監督學習, NLP, Transformer, 語言理解]
ipas_term: false
---

# 遮罩語言模型預測（MLM）（Masked Language Modeling）

一種自監督預訓練任務，隨機遮蔽輸入序列中的部分 token，讓模型依據上下文預測被遮蔽的原始詞，是 BERT 系列模型的核心訓練目標。

## 完整說明

遮罩語言模型（Masked Language Modeling，MLM）是一種用於預訓練 Transformer 編碼器（Encoder）的自監督學習任務。訓練時，輸入序列中隨機選取部分 token（通常約 15%）並替換為特殊符號 [MASK]，模型需根據其餘上下文 token 預測被遮蔽位置的原始詞。這種雙向上下文建模方式賦予 BERT 等模型對語言的深度理解能力，廣泛用於文本分類、問答、實體識別等下游任務的 fine-tuning 基礎。

## 常見問題

### MLM 和 GPT 系列的訓練方式有什麼根本差異？

MLM（BERT 等）使用雙向注意力，訓練目標是預測被隨機遮蔽的詞（完形填空），能同時利用左右兩側的上下文；GPT 系列使用單向自迴歸方式，訓練目標是預測序列中的下一個詞，只能看到左側已生成的內容。因此 MLM 更適合需要理解整個句子語境的任務（分類、問答），而自迴歸模型更適合文字生成任務。現代大型語言模型（如 GPT-4、Claude）多採用自迴歸架構，因為生成能力更受重視。

### 為什麼 BERT 的遮蔽策略要混合三種處理方式，而不是全部替換為 [MASK]？

若所有遮蔽位置都替換為 [MASK]，模型在 fine-tuning 和實際使用時不會見到 [MASK]，造成預訓練與使用情境的分佈不一致（Pretrain-Finetune Discrepancy）。BERT 的解決方案是：80% 時間替換為 [MASK]（主要訓練信號）；10% 替換為隨機詞（迫使模型不能只依賴位置標記，而需要真正理解上下文）；10% 保持原詞不變（讓模型學會不是每個 token 都需要被「修正」）。這三種方式的混合使模型的表示更適合各種下游任務情境。

### MLM 訓練出的 BERT 可以直接用於文字生成嗎？

BERT 等 MLM 模型設計上並不適合自迴歸文字生成，因為其架構是雙向編碼器，一次看到完整輸入，而生成任務需要逐步產生詞彙（每次只能看到已生成的部分）。雖然技術上可以用 BERT 做填空生成，但效果遠不及 GPT 等自迴歸模型。若需要兼具理解和生成能力，可考慮 Encoder-Decoder 架構（如 T5、BART），或使用現代指令微調的大型語言模型（如 Claude、GPT-4）。

---

來源：https://aiterms.tw/terms/masked-language-modeling
快查頁：https://aiterms.tw/terms/masked-language-modeling
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-masked-language-modeling