---
title: "多智能體強化學習（Multi-agent Reinforcement Learning）"
slug: multi-agent-reinforcement-learning
language: zh-TW
source: https://aiterms.tw/terms/multi-agent-reinforcement-learning
updated_at: 2026-06-22
tags: [強化學習, AI基礎, 深度學習, AI應用]
ipas_term: false
---

# 多智能體強化學習（Multi-agent Reinforcement Learning）

多個智能體在同一環境中互動的強化學習，須處理協作、競爭和通訊等複雜關係。

## 完整說明

多智能體強化學習擴展單智能體強化學習，研究多個智能體如何在共享環境中互動、學習和決策。智能體間可存在協作（共同目標）、競爭（衝突目標）或混合關係。多智能體環境的複雜性在於環境非穩定（因其他智能體行為改變），需發展新理論和演算法處理多智能體動態。

## 常見問題

### 多智能體強化學習中如何保證收斂？

多智能體環境非穩定，無法保證絕對收斂，只能追求局部收斂性質。常見目標是收斂到納什均衡，但並非所有環境都有純策略均衡。主要方法包括：一、減少智能體數量和行為複雜度，簡化環境；二、引入中央協調者或全局獎賞，降低學習難度；三、使用自玩(self-play)，智能體與自己歷代版本對抗，減少環境波動；四、引入通訊機制，智能體顯式協調；五、使用多智能體演算法專用設計，如QMIX、MAPPO，針對多智能體特性優化。完全保證困難，實踐中追求穩定學習曲線和合理性能。

### 多智能體強化學習中通訊的作用是什麼？

通訊顯著改進協作效率。無通訊時，智能體只通過觀察他人行為推測意圖，推理過程緩慢且易出錯。有通訊時，智能體能直接交換信息協調策略。例如多機器人搜救，無通訊時需推測他人搜索區域，容易重複；有通訊時直接分配區域，效率倍增。通訊可符號化（離散消息如「向北」）或連續（向量表示）。學習什麼通訊是核心研究，系統需自動發現有效的通訊協議。缺點是通訊成本（帶寬、延遲、能耗），實際應用中需權衡。

### 如何選擇多智能體強化學習的架構？

選擇應考慮任務性質和實際約束。協作任務推薦中央訓練分散執行(CTDE)，訓練時全局信息可用加速學習，執行時各智能體獨立減少依賴。競爭或混合任務推薦自玩，系統自動適應對手進化。限制通訊或低通訊環境推薦隱式協調，智能體通過行為推測意圖。允許豐富通訊推薦顯式協調，智能體發送信息。計算資源充足推薦分散學習，各智能體獨立計算；資源限制推薦中央計算。實踐中常混合，例如基礎策略用CTDE快速訓練，細化通過自玩。

---

來源：https://aiterms.tw/terms/multi-agent-reinforcement-learning
快查頁：https://aiterms.tw/terms/multi-agent-reinforcement-learning
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-multi-agent-reinforcement-learning