---
title: "通用分割模型（Segment Anything Model）"
slug: segment-anything-model
language: zh-TW
source: https://aiterms.tw/terms/segment-anything-model
updated_at: 2026-06-22
tags: [電腦視覺, 深度學習, 神經網路]
ipas_term: false
---

# 通用分割模型（Segment Anything Model）

Meta提出的大規模基礎模型，能對任意圖像進行實例分割，採用提示工程實現靈活的互動式分割。

## 完整說明

Segment Anything Model（SAM）是Meta AI於2023年發布的零樣本實例分割基礎模型。它能對任意圖像進行分割，無需針對特定任務的微調。SAM支持多種提示輸入方式（點、邊界框、文本等），使用戶能靈活地指定要分割的物體。其設計目標是構建通用的分割基礎模型，類似BERT在NLP中的角色。

## 常見問題

### SAM如何支持多種提示形式，且不同提示的編碼方式有何區別？

SAM設計了針對不同提示形式的編碼器。點提示（前景點或背景點）被編碼為特定的嵌入向量，其中前景點和背景點有不同的嵌入。邊界框被編碼為其對角的兩個點。粗略遮罰（由用戶畫的低分辨率遮罵）被輸入到一個小型卷積網絡，生成特徵表示。沒有提示時，使用預設的學習向量。所有提示編碼最終被加到圖像編碼的特徵上，供解碼器使用。這樣的設計使得SAM能靈活處理各種提示方式，用戶可根據具體情景選擇最方便的提示方式。多個提示可以累積，逐步精煉分割結果。

### 為什麼SAM可以一次編碼圖像然後快速處理不同提示？

SAM的架構將計算分為兩部分：重的圖像編碼和輕的提示編碼與解碼。圖像編碼器（Vision Transformer）需要處理整個圖像，計算複雜。但這個編碼可以一次性進行，然後結果被緩存在GPU內存中。後續處理不同提示時，只需進行輕量級的提示編碼（簡單的嵌入查詢或小網絡）和解碼（Transformer層和上採樣），計算量遠小於重新編碼圖像。這使得互動式分割可以實時進行，用戶點擊一點後毫秒級返回結果，實現流暢的互動體驗。這樣的設計理念與大型語言模型的編碼-解碼分離類似。

### SAM輸出多個遮罵時，應該如何選擇？

SAM輸出多個遮罵候選以及對應的置信度分數（通常為0-1之間的浮點數）。置信度分數反映了模型對該遮罵正確性的確信度，基於多層特徵和訓練目標。一般策略是選擇置信度最高的遮罵。但在某些情況下，用戶可根據視覺檢查手動選擇，或根據應用需求（如更保守地包含物體邊界）選擇其他遮罵。多遮罰輸出也支持後續的互動精煉，例如用戶如果對某個遮罵不滿意，可以添加額外的提示進一步改進。SAM的設計鼓勵這種互動迭代過程，而不期望一次完美分割。

---

來源：https://aiterms.tw/terms/segment-anything-model
快查頁：https://aiterms.tw/terms/segment-anything-model
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-segment-anything-model