---
title: "影像描述生成（Image Captioning）"
slug: image-captioning
language: zh-TW
source: https://aiterms.tw/terms/image-captioning
updated_at: 2026-07-30
tags: [電腦視覺, 自然語言處理, 多模態AI, 深度學習]
ipas_term: false
---

# 影像描述生成（Image Captioning）

影像描述生成（Image Captioning）是電腦視覺與自然語言處理的交叉任務，旨在讓模型自動為輸入影像產生自然語言描述，是多模態 AI 的核心應用之一，評估指標常用 BLEU、CIDEr、SPI

## 完整說明

影像描述生成（Image Captioning）要求模型理解影像的視覺內容（物體、場景、動作、空間關係），並將此理解轉化為流暢且語意準確的自然語言句子。早期方法以 CNN 提取視覺特徵後接 LSTM 解碼為主；現代方法以視覺 Transformer（ViT）或 CLIP 作為影像編碼器，搭配大型語言模型（LLM）作為解碼器，形成視覺語言模型（VLM）架構。影像描述生成的挑戰在於：視覺內容的多樣性（一張影像有多種合理描述）、語言表達的豐富性（同義詞、不同語法結構）、以及長尾事物的識別能力。代表資料集包括 MSCOCO（共 330K 影像，每張有 5 個人工標注描述）和 Flickr30K。此任務

## 常見問題

### 影像描述生成中的「幻覺問題（Hallucination）」是什麼，如何緩解？

影像描述中的幻覺指模型生成了影像中實際不存在的物體、屬性或關係，例如描述一張只有貓的圖片時提到「狗」，或描述室內場景時加上「陽光照射」的細節。幻覺的主要成因有三：（1）模型在訓練時過度依賴語言先驗（如「公園裡通常有樹」），而非仔細分析影像內容；（2）資料集中的描述本身帶有人類的主觀補充；（3）訓練目標（如 BLEU 最大化）與忠實度（Faithfulness）不完全對齊。緩解方法包括：強化學習人類反饋（RLHF）讓模型學習「不確定就不說」；以幻覺偵測資料集（如 CHAIR 指標）評估並過濾；採用視覺紮根（Visual Grounding）技術讓每個生成詞都對應影像中的具體區域。

### 影像描述生成與視覺問答（VQA）的主要差異是什麼？

兩者都是多模態任務，輸入都包含影像，但目標和難度側重不同。影像描述生成是開放式生成任務：在沒有具體問題引導下，模型必須自主決定「描述什麼」，生成完整的自然語言句子，重點在廣度（覆蓋影像的主要內容）和語言流暢性。視覺問答（VQA）是條件式生成任務：有具體問題引導，如「這隻狗的顏色是什麼？」，通常輸出短答案，重點在精確性和推理能力，尤其是需要常識推理（如「如果圖中的人帶著雨傘，說明可能是什麼天氣？」）的問題。兩個任務都用於評估多模態模型，但 VQA 的答案更容易量化評估（準確率），而影像描述的品質評估更複雜，需要多種指標配合人工判斷。

### 影像描述生成在 iPAS AI 應用規劃師考試中的考察重點有哪些？

在 iPAS AI 應用規劃師中級考試中，影像描述生成作為多模態 AI 和電腦視覺與 NLP 交叉的典型任務考察，主要面向包括：（1）任務定義：輸入影像、輸出自然語言描述，是電腦視覺與 NLP 的交叉任務；（2）模型架構演進：從 CNN+LSTM 到 Transformer 和大型視覺語言模型（VLM）的發展脈絡；（3）評估指標：BLEU 的侷限性及 CIDEr、SPICE 的設計動機；（4）應用場景：無障礙輔助（Alt-text 自動生成）、電商圖片標注、醫療報告生成；（5）與相關任務的區別：影像描述 vs. 視覺問答（VQA）vs. 影像分類的輸入/輸出和目標差異。考試常以應用情境選擇題的形式出現，判斷哪種多模態任務適合特定業務需求。

---

來源：https://aiterms.tw/terms/image-captioning
快查頁：https://aiterms.tw/terms/image-captioning
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-image-captioning