---
title: "策略自我（Policy Self）"
slug: policy-self
language: zh-TW
source: https://aiterms.tw/terms/policy-self
updated_at: 2026-06-22
tags: [強化學習, 策略梯度, 多代理人系統, 自我對弈, RLHF, 機器學習基礎]
ipas_term: false
---

# 策略自我（Policy Self）

強化學習中代理人用於表示自身行動策略的機制，區分當前被最佳化的策略與環境互動所用的策略。

## 完整說明

策略自我（Policy Self）是強化學習（Reinforcement Learning）中的概念，指代理人（Agent）自身所持有的行動策略（Policy）在學習過程中的角色與身份區分。在 Off-policy 學習框架中，代理人往往同時維護一個「目標策略」（Target Policy，待最佳化的策略）與一個「行為策略」（Behavior Policy，用於與環境互動產生資料的策略），Policy Self 的概念有助於區分這兩個角色在演算法更新中的不同作用。

## 常見問題

### Policy Self 和 Behavior Policy 有什麼區別？

Policy Self 通常指代理人當前持有的、正在被最佳化的策略（即 Target Policy），也就是代理人「自己的策略」；而 Behavior Policy 是用於與環境互動收集資料的策略，可能不同於 Target Policy。在 On-policy 方法（如 SARSA）中，兩者相同，代理人用自己的策略探索並更新自己的策略；在 Off-policy 方法（如 Q-learning、DQN）中，Behavior Policy 通常比 Target Policy 更具探索性（如 ε-greedy 策略），使代理人能探索更廣的狀態空間，同時用收集到的資料更新 Target Policy。這種分離是 Off-policy 方法能利用 Replay Buffer 重複使用歷史資料的關鍵機制。

### 自我對弈（Self-Play）中的 Policy Self 是如何運作的？

在自我對弈框架中，Policy Self 指代理人用自身（或歷史版本的自身）作為對手進行訓練。以棋類遊戲為例，代理人的策略網路同時控制雙方落子，透過與自己對弈產生訓練資料並更新策略，逐漸提升至人類難以企及的水準。AlphaZero 的實現方式是定期儲存當前策略的快照作為「對手池」（Opponent Pool），讓當前策略與過去版本的自己對弈，確保訓練信號穩定且難度逐步提升。這種設計能夠自動產生多樣化的訓練情境，不需要人類先驗知識即可達到超人表現，是強化學習在棋類遊戲中取得突破的關鍵技術。

### 在大型語言模型的 RLHF 訓練中，Policy Self 扮演什麼角色？

在 RLHF（Reinforcement Learning from Human Feedback）框架中，被訓練的語言模型就是 Policy Self，其策略是根據輸入 prompt 生成文本回應的條件機率分佈。訓練流程中，Policy Self 先由監督式微調（SFT）初始化，再透過 PPO 等強化學習演算法根據獎勵模型（Reward Model）的評分持續更新。為了防止策略更新過度偏離初始行為（如胡說八道或規避安全限制），RLHF 通常加入 KL 散度懲罰項，約束 Policy Self 與參考策略（Reference Policy，通常是 SFT 初始版本）的差距。這正是 Policy Self 在 LLM 對齊訓練中的核心作用：在最大化人類偏好評分的同時維持語言品質與安全性的平衡。

---

來源：https://aiterms.tw/terms/policy-self
快查頁：https://aiterms.tw/terms/policy-self
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-policy-self