---
title: "模仿學習（Imitation Learning）"
slug: imitation-learning
language: zh-TW
source: https://aiterms.tw/terms/imitation-learning
updated_at: 2026-07-30
tags: [監督學習, 強化學習, 專家演示, 行為克隆]
ipas_term: false
---

# 模仿學習（Imitation Learning）

透過學習專家演示直接訓練智能體策略的監督學習方法。

## 完整說明

模仿學習（Imitation Learning）是一種行為克隆的概括框架，智能體觀察專家（人類或已訓練的智能體）的行為演示，用監督學習訓練自己的策略以複製專家行為。相比從零開始的強化學習，模仿學習通常樣本效率更高、訓練時間更短，適合需要快速冷啟動的應用。

## 常見問題

### 為什麼行為克隆在執行時會「跌出懸崖」？DAgger如何解決？

行為克隆的悲劇在於：一旦模型出錯，偏離了專家軌跡分布，它進入了完全陌生的狀態，而這個狀態的糾正方式在訓練資料中根本不存在（訓練只有專家的「正確」狀態），所以無法恢復，錯誤越滾越大。DAgger透過主動採集策略自己犯錯的狀態，並獲取專家在這些狀態的動作，使訓練資料逐漸包含「如何從錯誤狀態恢復」。這樣每次迭代，模型的決策分布越來越接近實際執行會遇到的狀態分布，最終規避了分布移位。

### 模仿學習何時比強化學習更合適？

模仿學習在以下情況更合適：第一，有大量高品質專家演示可用（如駕駛日誌、操作視頻），而強化學習則要求訓練環境可交互與可重複；第二，快速冷啟動是優先級，初期有可用的基礎模型比最終的最優性更重要；第三，獎勵函數難以設計，而專家行為清晰易得（如複雜操控任務）；第四，安全性關鍵，無法容忍訓練期間的隨意探索（如醫療、駕駛）。相反，若無專家數據但有模擬環境、或需要發現超越專家的新策略，強化學習更適合。

### 怎麼處理多個風格不同的專家演示？

直接混合不同專家的演示會產生衝突的訓練信號，導致模型學習平均但平庸的策略。更好的做法有：第一，聚類專家風格，分別訓練不同模型或用多任務學習顯式學習多種風格；第二，用專家特徵（如風格標籤）作為模型條件，使模型能在多種風格間切換；第三，選用最優或最相關的少數專家演示而非全量混合；第四，用不確定性估計量化演示衝突區域，在這些區域減少依賴而靠強化學習自適應。

---

來源：https://aiterms.tw/terms/imitation-learning
快查頁：https://aiterms.tw/terms/imitation-learning
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-imitation-learning