---
title: "時間動作定位（Temporal Action Localization）"
slug: temporal-action-localization
language: zh-TW
source: https://aiterms.tw/terms/temporal-action-localization
updated_at: 2026-06-23
tags: [電腦視覺, 深度學習, AI應用]
ipas_term: false
---

# 時間動作定位（Temporal Action Localization）

在視頻中精確識別和定位動作發生的時間段，給出動作開始和結束的時間戳。

## 完整說明

時間動作定位是指在未經分割的長視頻中，自動識別特定動作發生的時間區間（開始時間和結束時間）的技術。與行動識別只需分類預定義動作不同，時間動作定位還需要精確確定動作在時間軸上的邊界位置。這項技術在視頻摘要、監控異常檢測和運動分析等領域具有重要應用價值。

## 常見問題

### TAL 系統為什麼需要多尺度架構？簡單的單一尺度卷積不行嗎？

因為動作持續時間差異巨大。眨眼持續約 100 毫秒，而一次演講可能持續 30 分鐘。單一卷積核大小無法同時捕捉這兩個極端。如果用大卷積核（如 16 幀），眨眼被當作背景；如果用小卷積核（如 3 幀），演講被碎片化分析。多尺度架構通常包含多個並行分支，每個分支用不同大小的卷積核，最後融合結果。這樣系統可以同時處理秒級和分鐘級的動作。

### 邊界檢測中的「非最大值抑制」（NMS）是什麼？為什麼需要？

NMS 是一種去除冗餘檢測結果的方法。在 TAL 中，由於特徵提取和邊界預測的連續性，往往會生成大量重疊的提案。例如，可能同時檢測到 [00:10-00:15]、[00:11-00:15]、[00:10-00:16] 三個近乎相同的動作提案。NMS 保留置信度最高的那個，抑制（刪除）其他重疊的提案。這樣輸出結果更清潔，避免後續處理時的冗餘計算。

### 如何訓練 TAL 模型？需要什麼樣的標籤數據？

訓練需要標註好的長視頻數據集，每個視頻需要逐個標註動作發生的開始和結束時間戳。例如，一個籃球比賽視頻的標籤可能是：[(進球, 00:05-00:08), (搶球, 00:20-00:25), ...]。這種標註非常耗費人力。許多開發者使用現有公開數據集（如 THUMOS、ActivityNet）進行預訓練，然後在特定領域的小規模標註數據上微調。損失函數通常包含邊界損失（讓預測邊界接近真實邊界）和分類損失（正確分類動作類型）。

---

來源：https://aiterms.tw/terms/temporal-action-localization
快查頁：https://aiterms.tw/terms/temporal-action-localization
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-temporal-action-localization