---
title: "三維視覺（3D Vision）"
slug: 3d-vision
language: zh-TW
source: https://aiterms.tw/terms/3d-vision
updated_at: 2026-06-23
tags: [電腦視覺, 深度學習, AI應用]
ipas_term: false
---

# 三維視覺（3D Vision）

利用多個視角或深度信息重構和理解三維場景的技術，包括物體形狀、位置和空間關係。

## 完整說明

三維視覺是指使用計算機系統從圖像或點雲數據中提取和理解三維空間信息的技術。系統可以重構物體的三維形狀、估計相機位置、檢測物體空間位置和方向等。三維視覺廣泛應用於機器人控制、自動駕駛、虛擬現實和醫療影像分析等領域，是連接二維影像和三維物理世界的橋梁。

## 常見問題

### 為什麼說立體視覺在紋理缺乏區域容易失效？

立體視覺的核心是在兩幅圖像中找到匹配的點對。匹配依賴於圖像特徵的唯一性：如果一個區域紋理豐富，很容易找到它在另一幅圖中的對應位置；如果區域空白（如白牆或天空），所有相似的白色區塊看起來幾乎相同，算法無法確定正確的匹配。這導致深度預測錯誤或缺失。深度估計網絡可以通過學習語義信息（「這是白牆，通常較遠」）來補償這個弱點。

### 結構從運動（SfM）和同時定位與地圖構建（SLAM）有什麼區別？

兩者都從視頻重構三維結構和估計相機軌跡，但應用場景和約束不同。SfM 通常用於事後處理：收集全部視頻後離線計算。SLAM 用於實時應用（如機器人、AR），邊探索邊構建，需要即時處理。SLAM 通常增加運動模型和概率推理（如卡爾曼濾波）確保穩定性。另一個區別是，SfM 通常假設場景靜態，SLAM 可以處理動態障礙物。

### 如何訓練深度估計網絡？需要什麼樣的數據？

深度估計通常採用監督學習，需要 RGB 圖像和對應的深度地真值。數據來源包括：（1）RGB-D 相機（如 Kinect）捕捉的真實數據；（2）合成數據集（如虛擬場景生成的無限逼真圖像和深度）。大規模公開數據集包括 NYU Depth、KITTI、Cityscapes 等。損失函數通常使用逐像素的 L1 或 L2 誤差。近年來，也有無監督和自監督方法利用視頻的多幀一致性進行訓練，無需地真值深度。

---

來源：https://aiterms.tw/terms/3d-vision
快查頁：https://aiterms.tw/terms/3d-vision
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-3d-vision