---
title: "目標定位（Grounding）"
slug: grounding
language: zh-TW
source: https://aiterms.tw/terms/grounding
updated_at: 2026-06-22
tags: [電腦視覺, 多模態AI, 神經網路]
ipas_term: false
---

# 目標定位（Grounding）

在圖像中定位自然語言描述的物體，通過將文本表達與圖像中的視覺區域進行對應，實現視覺語言理解。

## 完整說明

目標定位（Grounding）是指根據自然語言表達，在圖像中精確定位相應物體的邊界框或分割遮罩。例如，給定「紅色的球」這個文本描述，模型需要輸出圖像中紅色球的邊界框位置。目標定位是多模態理解的重要組成，應用於視覺對話、圖像搜索、互動式編輯等領域。現代目標定位模型結合了視覺Transformer、文本編碼器和跨模態對齐機制。

## 常見問題

### 如何使目標定位理解複雜的自然語言描述，如「不是紅色的最大球」？

複雜描述的理解涉及幾個層面。首先，文本編碼器（如BERT）必須理解語言結構，包括否定、比較級等。其次，視覺編碼器必須提供足夠的視覺細節，以區分不同顏色和大小的球。第三，跨模態融合機制必須將文本語義傳遞到視覺特徵中。例如，對於「不是紅色的」，模型應該低估圖像中紅色區域的注意力權重；對於「最大的」，應該增強大尺度視覺特徵。這通常通過大規模訓資料和精心設計的目標函數實現。現代模型（如GLiP）使用自然語言監督和弱標籤，在大規模圖文對資料集上訓練，學習複雜的語言-視覺對應。在訓練中，模型看到多樣的描述和邊界框配對，逐漸學習複雜語言的視覺含義。

### 目標定位模型如何在訓練資料不足時泛化到未見過的物體類別？

這涉及遷移學習和開放詞彙學習。一個策略是在大規模圖文對資料集（如4億對的LAION）上進行預訓練，學習視覺語言對齐。預訓練後，模型在有邊界框標籤的較小資料集（如RefCOCO）上微調。預訓練的視覺語言對齐使得模型能夠理解任意類別的文本描述，即使訓練資料中沒有見過該類別。例如，模型可能沒在狐狸上訓練，但因為理解了動物的視覺特徵和「狐狸」的語義，仍能定位狐狸。另一個策略是使用大型語言模型進行提示工程，利用LLM的知識進行零樣本定位。現代方法如OWL-ViT就是這樣結合ViT和文本編碼器的開放詞彙檢測框架。

### 為什麼目標定位需要多尺度特徵而不是單一尺度特徵？

物體在圖像中的大小變化很大，從小的蒼蠅到大的建築物。單一尺度的特徵圖無法同時有效表示各種大小的物體。小物體需要高分辨率特徵（保留細節），大物體可以用低分辨率特徵（提供上下文）。多尺度特徵金字塔（FPN）提供不同分辨率的特徵，使定位模型能在合適的尺度上定位各種大小的物體。此外，多尺度特徵提供了更豐富的上下文，幫助模型更好地理解物體與周圍環境的關係。例如，定位「桌子上的蘋果」時，高分辨率特徵捕捉蘋果的細節，低分辨率特徵提供桌子和空間上下文。因此，高效的多尺度特徵提取和融合是現代目標定位模型的標準設計。

---

來源：https://aiterms.tw/terms/grounding
快查頁：https://aiterms.tw/terms/grounding
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-grounding