---
title: "注意力線性偏置（ALiBi）"
slug: alibi
language: zh-TW
source: https://aiterms.tw/terms/alibi
updated_at: 2026-06-22
tags: [大型語言模型, 深度學習, 神經網路, 模型訓練]
ipas_term: false
---

# 注意力線性偏置（ALiBi）

一種相對位置編碼方法，通過在注意力分數中添加位置相關的線性偏置項，實現相對位置編碼且具有優秀的外推性能。

## 完整說明

注意力線性偏置（Attention with Linear Biases, ALiBi）是由 Meta AI Research 在 2022 年提出的位置編碼方法。ALiBi 無須在嵌入層添加位置信息，而是直接在注意力分數計算中添加位置相關的線性偏置項。ALiBi 的優勢包括：實現簡潔，無須修改嵌入層，具有優異的外推性能（訓練在短序列上的模型可推理更長序列），已被 BLOOM、OPT 等大規模多語言模型採納。

## 常見問題

### 為什麼 ALiBi 的外推性優於絕對位置編碼？

絕對位置編碼（如 Sinusoidal）為每個位置分配一個固定的位置向量，訓練時模型學習位置與語義的對應關係。超出訓練長度的位置被映射到未見過的向量空間，模型對此無所知，導致推理失敗。ALiBi 的偏置項直接基於位置距離 |i - j| 計算，這是一個純數學關係，無須訓練，因此對任何距離都適用。即使推理時遇到超長序列（如訓練 1024，推理 4096），|i - j| 的計算仍然有效，無須重新訓練或特殊處理。這是 ALiBi 相對位置編碼的本質優勢。

### ALiBi 的斜率參數 m_h 如何學習？

斜率 m_h 通常初始化為 1 / (2^(8h / H))，然後在訓練中作為可學習的參數。優化器（如 Adam）在反向傳播過程中更新這些斜率，使其適應特定任務和語料的需求。不同的頭學習到不同的斜率，反映了它們對距離的不同敏感性。某些頭學習到較陡的斜率（m 較大），重點關注近距離；某些頭學習到較平緩的斜率（m 較小），更關注遠距離。這種自適應的斜率學習使 ALiBi 能靈活適應不同任務的位置依賴特性。

### 使用 ALiBi 訓練的模型能否改用其他位置編碼進行推理？

理論上可以，但不推薦。用 ALiBi 訓練的模型，其注意力權重是針對 ALiBi 的偏置模式優化的。突然改用其他位置編碼（如 RoPE）可能導致推理結果不當，因為注意力權重分佈不再匹配。如果必須轉換，通常需要進行微調，讓模型重新適應新的位置編碼方案。反之亦然。因此，最佳實踐是從一開始就選定位置編碼方法，貫穿訓練和推理全程。不同方法之間的轉換需謹慎，且通常需要額外的適配工作。

---

來源：https://aiterms.tw/terms/alibi
快查頁：https://aiterms.tw/terms/alibi
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-alibi