---
title: "圖文對齐（Image-Text Alignment）"
slug: image-text-alignment
language: zh-TW
source: https://aiterms.tw/terms/image-text-alignment
updated_at: 2026-06-22
tags: [多模態AI, 深度學習, 神經網路]
ipas_term: false
---

# 圖文對齐（Image-Text Alignment）

在多模態學習中，將圖像和文本的表示映射到共同的語義空間，使得語義相關的圖文對的表示相近。

## 完整說明

圖文對齐是指通過訓練使圖像和對應文本在高維向量空間中相鄰，而不相關的圖文對則相距較遠。這一技術是視覺語言預訓練（如CLIP）的基礎。通過對齐，模型能夠實現跨模態檢索（用文本搜索圖像或反之）、零樣本分類等應用。對齐的品質決定了多模態模型的下游任務性能。

## 常見問題

### 為什麼圖文對齐需要對比損失而不是簡單地最大化相似度？

如果只最大化正樣本對的相似度，模型會學到退化解，即所有表示都變成相同的向量（或常數向量）。此時損失為0，但表示完全無用。對比損失的關鍵在於同時考慮負樣本：最大化正樣本相似度的同時，最小化負樣本相似度。這強制模型區分不同的圖文對，學習有區別的表示。具體地，InfoNCE損失將正樣本的相似度分子放在softmax中，負樣本作為分母的一部分。溫度參數τ控制損失的集中度：τ越小，損失對相似度差異越敏感，訓練越困難但收斂後表示更好；τ越大，訓練越容易但表示可能不夠好。

### 批大小為什麼對圖文對齐如此重要？

在對比損失中，批內的所有其他樣本都作為負樣本。批大小為N時，每個正樣本有N-1個負樣本競爭。更大的批提供更多、更難的負樣本，使得模型必須學習更好的區別性表示。小批（如64）只提供63個負樣本，對比信號弱；大批（如32768，如CLIP）提供32767個負樣本，訓練信號強。此外，大批還使得隨機梯度估計更穩定。這是為什麼分佈式訓練和大GPU系統在圖文對齐中至關重要，也是為什麼CLIP等模型需要大規模訓練基礎設施才能達到最優性能。

### 預訓練的圖文對齐模型如何在特定領域任務中微調？

微調有兩種主要方法。一是直接微調編碼器：固定預訓練的圖像和文本編碼器，在特定領域數據上微調投影層和分類頭。這保留了預訓練的表示能力，快速適應新領域。二是全面微調：解凍編碼器也進行微調，允許更深入的適應，但需要更多資料和更長訓練時間。在領域適應中，通常結合監督微調（給定正確標籤）和無監督微調（如對齐目標加領域特定數據）。CLIP的零樣本能力使其在資料稀缺領域特別有用，無需微調也能達到合理性能，或只需少量微調就能大幅提升。

---

來源：https://aiterms.tw/terms/image-text-alignment
快查頁：https://aiterms.tw/terms/image-text-alignment
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-image-text-alignment