---
title: "跨模態注意力（Cross-modal Attention）"
slug: cross-modal-attention
language: zh-TW
source: https://aiterms.tw/terms/cross-modal-attention
updated_at: 2026-06-22
tags: [多模態AI, 深度學習, 神經網路]
ipas_term: false
---

# 跨模態注意力（Cross-modal Attention）

融合來自不同模態（文本、圖像、音頻等）資訊的注意力機制，用於多模態深度學習任務。

## 完整說明

跨模態注意力是指在多模態學習中，讓一個模態的特徵對另一個模態的特徵進行加權聚合的注意力機制。典型應用包括視覺問答（VQA）、影像描述生成、視覺語言預訓練等任務。它使模型能夠在處理某一模態的信息時，選擇性地關注其他模態中最相關的部分，實現不同模態間的深層語義對齊。

## 常見問題

### 跨模態注意力如何處理不同模態特徵維度不同的問題？

跨模態注意力通過投影矩陣（或全連接層）將不同模態的特徵投影到共同的特徵空間。例如，圖像特徵維度可能是2048，文本特徵維度為768。定義投影矩陣W_q（用於查詢）和W_k（用於鍵），將它們都投影到相同維度d（如512）。投影後，可以計算它們之間的相似度：attention = softmax(Q W_q^T * (K W_k)^T / √d)。這樣的投影實現了特徵空間的對齐，使得不同模態的信息可以在共同空間中進行比較和融合。投影矩陣在訓練中可學習，模型自動學習到有效的對齐方式。

### 在視覺問答中，跨模態注意力如何確定應該關注圖像的哪個部分？

在VQA任務中，問題文本首先被編碼成特徵向量序列（通常是BERT的輸出）。這些文本特徵作為查詢Q，而圖像區域特徵（通常從Faster R-CNN或ViT提取）作為鍵K和值V。計算注意力權重時，模型學習如何根據問題的語義內容來評估每個圖像區域的相關性。例如，對於問題「有多少個人？」，模型會學習給予圖像中人物區域更高的權重。這種權重是通過反向傳播學習的，使得模型在訓練資料上最小化答案預測的損失。注意力權重反映了文本和視覺特徵的相似度分佈。

### 跨模態注意力為什麼需要雙向進行？

在許多多模態任務中，兩個模態都包含有用的信息，需要相互指導。在圖像描述生成中，不僅圖像對生成詞語有指導作用（視覺到文本），已生成的詞語也對應該關注圖像的哪個部分有指導作用（文本到視覺）。例如，當生成詞「狗」時，解碼器應該關注圖像中狗的位置；而圖像中狗的位置又應該指導生成狗相關的詞語。雙向注意力使模型能建立這樣的相互依賴關係。在視覺語言預訓練中，雙向跨模態注意力幫助模型深度理解圖文對的語義對應，提高預訓練效果。

---

來源：https://aiterms.tw/terms/cross-modal-attention
快查頁：https://aiterms.tw/terms/cross-modal-attention
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-cross-modal-attention