---
title: "代數注意力（Algebra Attention）"
slug: algebra-attention
language: zh-TW
source: https://aiterms.tw/terms/algebra-attention
updated_at: 2026-06-22
tags: [注意力機制, Transformer, 等變性, 幾何深度學習, 科學AI, 分子生成, 群論, 線性代數]
ipas_term: false
---

# 代數注意力（Algebra Attention）

將代數結構（如群、環、格等）引入注意力機制設計，以捕捉資料中具有代數對稱性或層次結構的關係。

## 完整說明

代數注意力（Algebra Attention）是一種將抽象代數（Abstract Algebra）的代數結構理論與 Transformer 注意力機制相結合的研究方向。傳統的點積注意力（Dot-product Attention）透過內積衡量 Query 與 Key 的相似度，而代數注意力則探索使用具有代數性質的操作（如群作用、線性映射的代數結構、格論等）來計算注意力分數或構造鍵值對，從而捕捉資料中傳統點積難以表達的代數對稱性、不變性或層次結構，應用於分子結構、數學推理與幾何圖形等具有固有代數性質的資料。

## 常見問題

### 代數注意力和標準的 Transformer 自注意力在計算上有什麼根本差異？

標準自注意力的計算核心是點積相似度：Score(Q, K) = softmax(QKᵀ / √d)，本質上衡量的是向量空間中的線性內積關係，對旋轉、置換以外的代數變換不具有感知能力。代數注意力的差異在於相似度函式或特徵交互方式的設計：以等變注意力為例，Query 和 Key 可能是等變特徵（如在 SE(3) 群作用下按照群表示變換的向量或張量），相似度計算採用群不變的內積形式（對旋轉平移不敏感的距離或角度），確保注意力分數本身對群作用保持不變性。對線性代數注意力而言，差異在於用矩陣分解或核函式估計替代 Softmax，使注意力矩陣具有低秩或可分解的代數結構，從而降低計算複雜度。根本上，代數注意力將對特定代數結構的感知性直接融入注意力機制的設計，而非依賴模型在訓練中隱式學習這些結構。

### 等變性（Equivariance）在代數注意力設計中為什麼重要？能舉個具體例子嗎？

等變性的重要性在於它讓模型能以「物理正確」的方式處理具有對稱性的資料，減少模型需要從資料中學習的信息量（對稱性由架構保證，而非靠資料量學習）。具體例子：在蛋白質結構預測中，同一個蛋白質分子無論在三維空間中如何旋轉，其物理化學性質（如結合自由能）都相同。若使用標準 Transformer，模型需要在訓練資料中見過足夠多的旋轉版本才能學到旋轉不變性；若使用 SE(3) 等變注意力，架構設計本身就保證了輸入旋轉時輸出的特徵以對應的方式旋轉（等變）或保持不變（對純量性質），模型從第一天起就是旋轉正確的，不需要資料增強，也不會在預測時因分子朝向不同而給出不同的結果。這在資料稀缺的科學應用中尤其珍貴，是 AlphaFold 2 採用等變幾何推理的核心動機之一。

### 代數注意力目前主要在哪些應用場景有實際落地案例？

目前代數注意力的實際落地案例主要集中在科學 AI 領域，尤其是需要處理具有明確代數或幾何對稱性的資料。分子性質預測與藥物發現是最成熟的方向：SE(3) 等變圖神經網路（如 SchNet、DimeNet、PaiNN）在預測分子能量、偶極矩等量子化學性質上達到近化學準確性，且在有限訓練資料下的表現顯著優於非等變基準模型。蛋白質結構預測與設計中，AlphaFold 2 雖未直接稱為代數注意力，但其幾何推理模組（Invariant Point Attention，IPA）在概念上是等變注意力的一個實例。材料科學中的晶體結構性質預測（具有空間群對稱性）是另一個應用場景。相較之下，代數注意力在自然語言處理與通用視覺任務中的落地案例較少，因為這些資料不像分子結構那樣有明確的物理群作用，架構設計的代數結構優勢不那麼突出。

---

來源：https://aiterms.tw/terms/algebra-attention
快查頁：https://aiterms.tw/terms/algebra-attention
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-algebra-attention