---
title: "多頭注意力機制（Multi-Head Attention）"
slug: multi-head-attention
language: zh-TW
source: https://aiterms.tw/terms/multi-head-attention
updated_at: 2026-06-22
tags: [Multi-Head Attention, 多頭注意力, Transformer, 自注意力, 深度學習]
ipas_term: false
---

# 多頭注意力機制（Multi-Head Attention）

Transformer 的核心元件，透過多組平行的注意力運算同時捕捉輸入序列在不同子空間中的依賴關係。

## 完整說明

Multi-Head Attention（多頭注意力機制）是 Transformer 架構的核心創新，將單一注意力機制擴展為多組平行的注意力頭（attention head）。每個頭使用獨立的線性投影，在不同的子空間中學習不同類型的依賴關係（如短距離語法關係、長距離語義關係）。各頭的輸出串接後，再經過一個線性層整合，使模型能從多角度同時理解輸入序列。

## 常見問題

### 注意力頭的數量（number of heads）對模型性能有什麼影響？

注意力頭的數量影響模型捕捉不同類型依賴關係的能力。在固定模型維度（dmodel）的前提下，頭數越多，每個頭的子空間維度（dₖ = dmodel / h）越小，每個頭能表達的資訊量也越有限，但多頭能並行捕捉更多元的模式。研究表明，並非頭數越多越好：有實驗顯示刪除某些頭對模型性能影響很小甚至有益（這些頭可能是冗餘的）。實務上，GPT-2 小型版本使用 12 頭，大型版本使用 25 頭；BERT-Base 使用 12 頭，BERT-Large 使用 16 頭。頭數通常是一個需要根據模型規模和任務特性調整的超參數，建議參考同類規模的基準模型設定，而非盲目增加。

### Flash Attention 是什麼？它怎麼加速 Multi-Head Attention？

Flash Attention 是由 Tri Dao 等人於 2022 年提出的高效注意力實作方法，核心思想是重新設計注意力矩陣的計算順序以最佳化 GPU 記憶體存取，數學結果與標準注意力完全相同，但實際執行速度大幅提升（測試顯示在長序列上可提速 2 至 4 倍）。標準注意力計算中，需要在 GPU 的 HBM（高頻寬記憶體）和 SRAM（靜態隨機存取記憶體）之間進行大量讀寫，而 SRAM 雖然速度快但容量有限（數 MB），HBM 雖容量大但延遲高。Flash Attention 將計算拆分成適合 SRAM 容量的小塊（tiling），盡量在快速的 SRAM 中完成計算，減少往返 HBM 的頻率。Flash Attention 2 和 3 進一步最佳化並行策略，已成為大多數主流訓練框架的標準元件。

### 不同注意力頭實際上學到了什麼？

研究人員透過視覺化注意力權重，發現不同的注意力頭確實學到了結構不同的語言模式。部分頭專注於相鄰詞的語法關係（如形容詞與名詞的搭配）；某些頭學習長距離的指代消解（代名詞指向哪個名詞）；另一些頭關注動詞與其論元之間的關係；還有頭幾乎只關注特定的句法結構（如介詞短語的附著）。然而，也有研究表明許多頭的功能是冗餘的，在大型模型中，相當比例的頭可以被剪枝掉而對性能影響有限。目前對注意力頭行為的解讀更多是描述性的觀察，而非嚴格的因果分析，注意力權重不能直接等同於模型的推理依據，這也是 NLP 可解釋性研究的持續課題。

---

來源：https://aiterms.tw/terms/multi-head-attention
快查頁：https://aiterms.tw/terms/multi-head-attention
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-multi-head-attention