---
title: "音視覺學習（Audio Visual Learning）"
slug: audio-visual-learning
language: zh-TW
source: https://aiterms.tw/terms/audio-visual-learning
updated_at: 2026-06-23
tags: [多模態AI, 深度學習, AI基礎]
ipas_term: false
---

# 音視覺學習（Audio Visual Learning）

利用音頻和視覺信息的相關性，訓練神經網絡進行特徵學習的方法，通常不需要人工標籤。

## 完整說明

音視覺學習是一種自監督學習方法，利用視頻中自然存在的音視頻配對關係作為訓練信號。系統學習使得音頻和視覺特徵在同一視頻中相近、在不同視頻中遠離。這種方法無需人工標籤，可利用互聯網上大量未標籤的視頻數據進行預訓練，顯著降低了標籤成本。

## 常見問題

### 為什麼說音視覺學習比有監督預訓練更具優勢？

主要優勢是成本和規模。有監督預訓練需要人類逐幀或逐秒地標籤視頻（「這是狗」「這是打籃球」），成本很高。而且高質量標籤常被限制在特定領域或語言。相比之下，互聯網上有數十億小時的未標籤視頻，且音視頻配對是自動存在的（無需人工標註）。使用這些數據，音視覺學習可以進行大規模預訓練，學到更通用的特徵表示。當然，如果標籤成本不是瓶頸，而且下游任務與標籤領域接近，有監督預訓練仍可能更優。

### 音視覺學習中的時間對齐為什麼困難？如何解決？

困難在於視頻製作中音軌和視軌可能出現偏移：配音視頻有意延遲、直播有網絡延遲、編輯時可能移動音軌。簡單假設音視同步會在訓練數據中引入噪聲。解決方案包括：（1）使用寬鬆的對齐窗口，比如認為視覺幀 t 對應時間 [t-2, t+2] 秒的音頻，而不是精確的 t 秒；（2）學習對齁模塊，自動估計音視軌間的延遲並修正；（3）篩選高度同步的視頻進行預訓練。這些方法都有權衡，需根據應用場景選擇。

### 如何區分真正的音視覺對應和虛假對應？

這是個開放問題。常見方法包括：（1）利用視頻的領域特性，如音樂視頻中樂器和聲音配對很強，但背景音樂可能弱；（2）使用多個視頻時間段的對齁度作為置信度加權，即使是同一視頻，不同時段的對應強度也不同；（3）結合其他信號，如同一時段物體運動和聲音頻率的變化是否同步；（4）在下游任務上驗證，如果某些預訓練特徵在行動識別上性能好，說明對應關係是有效的。在實踐中，通常接受一定比例的虛假對，因為充足的數據量和對比學習的魯棒性可以抵消這種噪聲。

---

來源：https://aiterms.tw/terms/audio-visual-learning
快查頁：https://aiterms.tw/terms/audio-visual-learning
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-audio-visual-learning