---
title: "視覺問答（Visual Question Answering）"
slug: visual-question-answering
language: zh-TW
source: https://aiterms.tw/terms/visual-question-answering
updated_at: 2026-07-29
tags: [機器學習, 深度學習, 電腦視覺, 自然語言處理, AI應用, 模型訓練, 模型評估]
ipas_term: false
---

# 視覺問答（Visual Question Answering）

> **你有沒有看過一張圖，還想直接問「這裡面是什麼」？**
> 你可以把視覺問答想成「看著圖片回答文字問題」
> 模型不只要看懂圖，還要把問題和圖像線索對起來
> 這比單純圖像分類更進一步，因為答案常需要推理
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆
> **視覺問答 vs 圖像分類**
> 視覺問答要回答問題
> 圖像分類只給一個類別標籤
> 最關鍵的區別：有沒有問題要回答
>
> **視覺問答 vs 圖像描述**
> 視覺問答是針對提問作答
> 圖像描述是整體描述圖片
> 最關鍵的區別：定向回答和整體敘述
>
> **視覺問答 vs 視覺語言模型**
> 視覺問答是任務
> 視覺語言模型是常見底層模型
> 最關鍵的區別：任務和模型
>

### 記住這句就好
> 先看圖，再抓問題關鍵字，最後把兩邊接起來回答。

### 實際案例
> **購物客服**
> 使用者上傳商品照片再問尺寸或顏色，系統可直接回覆，減少人工處理
>
> **教材理解**
> 學生看到圖表後問「哪一段最高」，模型要從圖像讀出對應位置再答題
>

### 算法與應用
> | 圖像特徵 | 先看圖片內容 | 是回答的基礎 |
> | 問題理解 | 抓出問題在問什麼 | 關鍵詞很重要 |
> | 注意力對齊 | 把問題和圖像區域連起來 | 常是性能關鍵 |
> | 答案生成 | 輸出簡短或句子型答案 | 常比分類更彈性 |

### 中英對照與常見說法

| 說法 | 出現場合 |
| --- | --- |
| 視覺問答 | 台灣與中國大陸通用譯名 |
| 视觉问答 | 簡體寫法 |
| Visual Question Answering | 英文原名 |
| VQA | 標準縮寫 |
| 圖像問答 | 口語變體，意思相同 |

### 一個 VQA 系統要做哪三件事

> **第一，看懂圖。** 用視覺編碼器把影像轉成特徵。早期用 CNN 加上物件偵測抽出區域特徵，現在多半用視覺 Transformer（ViT）直接切成影像區塊編碼。
>
> **第二，看懂問題。** 用語言模型把問題轉成向量表示。
>
> **第三，把兩邊對起來並回答。** 這一步是 VQA 的核心難點，叫做跨模態融合。做法從早期的簡單相乘、注意力機制，演進到現在把影像特徵直接投影成語言模型看得懂的 token，交給大型語言模型生成答案。
>
> 回答形式有兩種設計。**分類式**把答案限定在一個固定的候選集合（例如最常見的三千個答案），問題變成多選一，準確率好算但答不出集合外的東西。**生成式**直接產生文字，彈性大但評估困難，因為「兩個人」與「2 人」語意相同卻字串不同。

### 這個任務為什麼難

> **語言先驗偏誤（language prior bias）** 是 VQA 最著名的問題。模型可以完全不看圖，只靠問題的統計規律就答對相當比例的題目：問「香蕉是什麼顏色」答黃色、問「有幾隻」答二，正確率就不低。這代表高分不等於真的看懂圖。VQA-CP 這類資料集就是刻意把訓練集與測試集的答案分布錯開，用來揭穿這種取巧。
>
> **需要圖片以外的知識**。「這個標誌代表可以停車嗎」需要交通規則知識，光看圖看不出來。這類題目催生了知識型 VQA（Knowledge-based VQA）的研究方向。
>
> **計數與空間關係一直是弱項**。數超過五個物件、判斷「左邊數來第三個」，即使是現在的多模態大模型也常出錯。

### 實際用在哪

> 視障輔助（拍照問前面是什麼）、電商（問商品圖的細節）、醫療影像初步問答、工業檢測（問這張照片有沒有缺件）、教育與文件理解（問圖表上的數字）。

### 情境判斷
> **Q1（直覺題）：你問模型「這張圖裡有幾個人」，這屬於 VQA 嗎？**
> → 是，因為它要根據圖片回答文字問題。
>
> **Q2（判斷題）：如果題目只要模型寫出圖片內容摘要，還算同一類嗎？**
> → 比較接近圖像描述，不完全是 VQA。
>
### 常見問題
> **Q：視覺問答需要真的理解圖嗎？**
> 需要，至少要能把問題對應到圖中的區域或物件。
>
> **Q：它和聊天機器人有何不同？**
> 聊天機器人主要處理文字，VQA 還要加上影像。
>
> **Q：為什麼答案有時候很短？**
> 因為很多 VQA 資料集本來就以短答案為主。
>

### 相關術語
> - **視覺語言模型**：VQA 常靠它來做底層理解
> - **電腦視覺**：先懂影像，才能回答影像問題
> - **問答系統**：VQA 可視為問答系統的多模態版本
> - **注意力機制**：常用來對齊問題和圖像區域

---

來源：https://aiterms.tw/terms/visual-question-answering
快查頁：https://aiterms.tw/terms/visual-question-answering
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-visual-question-answering