---
title: "深度估計（Depth Estimation）"
slug: depth-estimation
language: zh-TW
source: https://aiterms.tw/terms/depth-estimation
updated_at: 2026-06-22
tags: [電腦視覺, 深度學習, 神經網路, AI應用]
ipas_term: false
---

# 深度估計（Depth Estimation）

從2D影像推斷場景的3D深度資訊，用於3D重建、機器人導航、AR應用和自動駕駛。

## 完整說明

深度估計是電腦視覺中從影像推斷場景深度（距相機距離）的技術。單眼深度估計從單張影像推斷深度，立體視覺從兩張具有視差的影像復原深度。深度資訊支撐3D場景理解、物體定位、自動駕駛中的障礙物距離估計、增強實境的虛實融合，以及機器人視覺導航。現代深度估計多採用深度學習方法，能在單眼模式下達到接近立體視覺的精度。

## 常見問題

### 為什麼單眼深度估計可能比立體視覺更精確？

傳統立體視覺受限於視差搜尋的離散性和歧義性。視差通常限制在有限範圍（如0-64像素），分辨率受此限制。紋理貧瘠區域難以匹配。現代單眼深度估計用深度學習直接迴歸連續深度值，無離散量化。訓練資料豐富時，模型學到豐富的幾何和語義線索：物體大小、位置、遮擋關係、透視變形等，綜合推斷深度。在紋理貧瘠區域也能從高層語義推斷（如已知汽車大小，可估計距離）。當訓練資料質量高、分佈廣時，單眼方法精度可超立體視覺。但單眼方法泛化到訓練域外時性能下降，而立體視覺原理簡單泛化強。

### 自監督單眼深度估計為什麼有效？

自監督方法利用視頻序列提供的自然監督信號。核心思想是一致性檢查：如果深度估計和光流都正確，用前幀和估計深度以及光流，應能重建當前幀。重建誤差（photometric loss）作為損失函數，無需人工標籤。這在視覺上合理：移動相機或場景中，不同部分應有一致的運動模式。自監督避免了昂貴的深度標註，能在任意視頻上訓練。缺點是遮擋和邊界處理困難，需加掩模分支。該方法已成功應用於無人車和無人機。

### 深度估計在自動駕駛中如何與其他感測器融合？

自動駕駛系統多感測器融合。攝像機通過深度估計或立體視覺提供稠密環境理解，優勢是成本低精度高、能捕捉紋理細節。雷達提供稀疏但精確的距離測量和速度估計，優勢是全天候（不怕光照）、抗遮擋。深度圖和雷達點雲可在多個層級融合。早期融合將兩者在特徵層結合，後期融合在決策層合併。特徵級融合需設計統一表達，點雲通常轉為深度圖或柱狀表達。多感測器融合提升了感知冗餘性和可靠性，是安全自動駕駛的基石。

---

來源：https://aiterms.tw/terms/depth-estimation
快查頁：https://aiterms.tw/terms/depth-estimation
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-depth-estimation