---
title: "注意力機制（Attention Mechanism）"
slug: attention-mechanism
language: zh-TW
source: https://aiterms.tw/terms/attention-mechanism
updated_at: 2026-07-29
tags: [深度學習, 自然語言處理, 神經網路, 模型訓練]
ipas_term: true
---

# 注意力機制（Attention Mechanism）

> **你讀長句子時會先抓重點，神經網路能不能也學會這樣看？**
> 你可以把注意力機制想成一個會分配關注權重的系統，重要的位置會被看得更仔細。
> 它特別擅長處理長序列，因為模型不必平均看待每個位置。
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆

> **注意力機制 vs 自注意力？**
> 注意力機制：依任務動態調整關注權重
> 自注意力：序列內部自己互相比對的重要形式
> 最關鍵的區別：自注意力是注意力機制的一種
>
> **注意力機制 vs 池化？**
> 注意力機制：重點在分配焦點
> 池化：重點在壓縮資訊
> 最關鍵的區別：注意力是在挑重點，池化是在縮資料
>
> **注意力機制 vs 固定特徵提取？**
> 注意力機制：可以和 RNN、Transformer 等架構搭配
> 固定特徵提取：每個位置被同等對待
> 最關鍵的區別：前者會學會看誰重要，後者常是平均處理
### 記住這句就好

> 哪裡重要，就多看哪裡
### 實際案例

> **機器翻譯**
> 翻譯一句長句時，模型會對應到原句裡最相關的詞，避免只看最後幾個字
>
> **文件摘要**
> 摘要模型會先抓出標題、關鍵名詞與重複主題，把不重要的句子權重調低
### 算法與應用

> | 重點 | 你要看什麼 | 為什麼重要 |
> |---|---|---|
> | Query | 當前要找什麼 | 告訴模型現在在問哪個重點 |
> | Key/Value | 可被比較的內容 | 讓模型比對哪個位置該被重視 |
> | 權重 | 相對重要性 | 決定最後保留多少資訊 |

### 中英對照與常見說法

| 說法 | 出現場合 |
| --- | --- |
| 注意力機制 | 台灣與中國大陸通用譯名 |
| 注意力机制 | 簡體寫法 |
| Attention Mechanism | 英文原名 |
| 自注意力（self-attention，自注意力机制） | 最常見的一種形式，Transformer 用的就是它 |
| 交叉注意力（cross-attention） | 兩個不同序列之間的注意力 |

### 它在解什麼問題

> 注意力機制最早是為了解決機器翻譯的瓶頸。早期的編碼器解碼器把整個來源句壓成一個固定長度的向量，句子一長，前面的資訊就被擠掉了。
>
> 注意力的做法是：**解碼每一個字的時候，都可以回頭看來源句的所有位置，並自己決定該看哪裡多一點。**
>
> 具體是三個角色的運算。每個位置產生 **Query（要找什麼）**、**Key（我是什麼）**、**Value（我帶的內容）**。用 Query 跟所有 Key 算相似度，經過 softmax 變成一組加起來等於 1 的權重，再拿這組權重去加權平均所有 Value。
>
> 標準的縮放點積注意力寫成：
>
> **Attention(Q, K, V) = softmax(QKᵀ / √d) V**
>
> 除以 √d 是為了避免維度變大時點積數值過大，讓 softmax 進入梯度接近 0 的飽和區。

### 為什麼同一個詞在不同句子裡意思會不同

> 這是注意力機制最常被問到的效果。以「銀行」為例，在「我去銀行存錢」裡它會對「存錢」給高權重，在「他坐在河的銀行邊」裡則會對「河」給高權重。**同一個詞的輸出向量是由它與上下文的加權組合算出來的，上下文不同，輸出就不同。**
>
> 這正是它跟早期詞向量（word2vec）最根本的差別：word2vec 給每個詞一個固定向量，一詞多義無法區分；注意力機制產生的是隨上下文變動的表示。

### 多頭與代價

> **多頭注意力（multi-head attention）** 把上述運算平行做很多份，每一份在不同的子空間裡看不同的關係，有的看語法、有的看指代、有的看距離。最後把所有頭的結果接起來。這讓模型能同時關注多種關係，而不是被迫用一組權重表達全部。
>
> **代價是計算量隨序列長度平方成長。** 序列變兩倍，注意力的計算與記憶體變四倍。這是長上下文成本高昂的根本原因，也是 FlashAttention、稀疏注意力、線性注意力這些技術想解決的問題。
>
> **注意力權重不等於解釋。** 把權重畫出來看起來很像模型的推理過程，但研究顯示同樣的預測可以由差異很大的注意力分布產生。拿它當視覺化參考可以，當成因果解釋不行。

### 情境判斷

> **Q1：一段文字很長，模型只看最後一個 token，這比注意力機制更適合嗎？**
> → 通常不適合，因為前文資訊可能被忽略，注意力能把相關位置拉回來
>
> **Q2：注意力權重高，就代表那個位置一定是造成答案的真正原因嗎？**
> → 不一定，權重高只表示模型重視它，不等於已經證明因果關係
### iPAS 考題

> **Q：注意力機制的主要目的為何？**
> 讓模型在處理序列時，能動態調整不同位置的關注程度。
>
> **Q：自注意力和注意力機制有什麼關係？**
> 自注意力是注意力機制的一種，重點在序列內部元素彼此關聯。
### 常見問題

> **Q：注意力機制可以完全取代 RNN 嗎？**
> 在很多語言任務上可以，但是否取代要看計算成本、資料型態與模型設計。
>
> **Q：注意力一定比較準嗎？**
> 不一定。它很強，但仍要看任務、資料量與訓練方式。
>
> **Q：注意力只能用在文字嗎？**
> 不是，影像、音訊與多模態資料也常會用到注意力。
### 相關術語

> - **自注意力**：這是注意力機制最核心的變形
> - **轉換器架構**：Transformer 幾乎整套都建立在注意力上
> - **解碼器**：很多生成模型在解碼時會用到注意力

---

來源：https://aiterms.tw/terms/attention-mechanism
快查頁：https://aiterms.tw/terms/attention-mechanism
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-attention-mechanism