---
title: "圖像識別（Image Recognition）"
slug: image-recognition
language: zh-TW
source: https://aiterms.tw/terms/image-recognition
updated_at: 2026-07-29
tags: [電腦視覺, 深度學習, 模型訓練, 模型評估, AI應用, 神經網路, 特徵工程, 資料處理, AI基礎]
ipas_term: false
---

# 圖像識別（Image Recognition）

> **你有沒有想過，AI 不只看出這是貓，還能知道這是誰、在哪裡、在做什麼？**
>
> 你可以把圖像識別想成對圖片做更廣義的辨認。
> 它比單純分類更進一步，會去認出物體、人物、場景或事件，常常還會牽涉位置資訊。
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆

> **圖像識別 vs 圖像分類**
> 分類只關心整張圖的類別
> 識別的範圍更廣，可能包括人物、場景和位置
> 最關鍵的區別是整體分類，還是廣義辨認
>
> **圖像識別 vs 物件偵測**
> 識別偏向知道是什麼
> 偵測還要知道在哪裡
> 最關鍵的區別是辨認本體，還是定位加辨認
>
### 記住這句就好

> 不只貼標籤，還要知道是什麼。

### 實際案例

> **相片搜尋**
> 手機或雲端相簿可以靠圖像識別找出人臉、地點或特定物件。
>
> **門禁和安防**
> 圖像識別常被用來辨認人員身份，協助門禁或監控系統。
>
### 算法與應用

> 圖像識別的範圍比圖像分類大，常和偵測、分割一起出現。
> 在實務上，模型好不好通常要看準確率、召回率和誤判成本。

### 中英對照與常見說法

| 說法 | 出現場合 |
| --- | --- |
| 圖像識別、影像辨識 | 台灣兩種說法都常見，「影像辨識」較正式 |
| 图像识别 | 簡體寫法 |
| Image Recognition | 英文原名 |
| 電腦視覺（Computer Vision） | 涵蓋範圍更廣的上位詞 |

### 幾個容易混淆的任務

| 任務 | 輸出 | 例子 |
| --- | --- | --- |
| 影像分類（classification） | 整張圖一個標籤 | 這是貓 |
| 物件偵測（detection） | 多個邊界框加類別 | 圖上有 2 隻貓，位置在這裡 |
| 語義分割（segmentation） | 每個像素一個類別 | 這些像素屬於貓 |
| 影像檢索（retrieval） | 相似影像清單 | 找出跟這張最像的商品 |
| 人臉辨識（face recognition） | 身分 | 這是誰 |

> 日常講「圖像識別」時，指的可能是上面任何一種。溝通規格時一定要問清楚要的是哪一個，因為資料標註成本與模型選擇差很多：分類只要一張圖一個標籤，分割要逐像素標，成本差上百倍。

### 技術演進

> **手工特徵時期**：SIFT、HOG 這類人工設計的特徵抽取器，加上 SVM 之類的分類器。表現受限於特徵設計的好壞。
>
> **卷積神經網路時期**：2012 年 AlexNet 在 ImageNet 上大幅領先之後，特徵改由網路自己學。之後是 VGG、ResNet（用殘差連接讓網路能疊到很深）、EfficientNet 這一系列。
>
> **Transformer 與多模態時期**：ViT 把影像切成區塊當序列處理；CLIP 用大量圖文配對訓練，讓模型能用文字描述辨識沒有專門訓練過的類別，這使得零樣本影像辨識變得實用。

### 實務上最常見的三個坑

> **訓練資料與實際場景不一致。** 用網路上乾淨的商品照訓練，上線後拍的是倉庫裡歪斜、反光、部分遮擋的照片，準確率直接腰斬。資料收集要盡量在真實環境下做。
>
> **模型學到了不該學的線索。** 所有正樣本都是同一台相機在同一個角度拍的，模型可能是靠背景或色調在判斷。用 Grad-CAM 這類工具看模型在注意哪裡，是最快發現這個問題的方法。
>
> **類別不平衡與長尾。** 實際場景裡少數類別佔絕大多數樣本，罕見但重要的類別（瑕疵、危險物）樣本極少。整體準確率會漂亮但沒有用，評估一定要看各類別的召回率。

### 情境判斷

> **Q1：** 你要讓系統在照片裡找出某個人，會想到什麼？
> → 圖像識別，若還要畫框定位，則會進一步用物件偵測。
>
> **Q2：** 你只要知道照片屬於哪一類，還需要完整識別嗎？
> → 不一定，只做圖像分類就夠了。
>
### 常見問題

> **Q：圖像識別和物件偵測一樣嗎？**
> 不一樣，物件偵測更重視位置。
>
> **Q：它常用什麼模型？**
> CNN、遷移學習和更進階的視覺模型都常見。
>
> **Q：有什麼限制？**
> 光線、角度、遮擋和資料偏差都會影響結果。
>
### 相關術語

> - **圖像分類**：先分清這兩者，邊界會更明確
> - **物件偵測**：圖像識別常會進一步延伸到這裡
> - **電腦視覺**：圖像識別就是這個領域的核心任務之一
> - **卷積神經網路**：很多識別模型的底層骨架
> - **深度學習**：現代圖像識別幾乎都離不開它

---

來源：https://aiterms.tw/terms/image-recognition
快查頁：https://aiterms.tw/terms/image-recognition
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-image-recognition