---
title: "可驗證獎勵強化學習（RLVR (Reinforcement Learning with Verifiable Rewards)）"
slug: rlvr-reinforcement-learning-with-verifiable-rewards
language: zh-TW
source: https://aiterms.tw/terms/rlvr-reinforcement-learning-with-verifiable-rewards
updated_at: 2026-06-22
tags: [強化學習, 推理模型, 後訓練, DeepSeek, 策略梯度]
ipas_term: false
---

# 可驗證獎勵強化學習（RLVR (Reinforcement Learning with Verifiable Rewards)）

透過可客觀驗證的獎勵信號（如數學題正確答案）訓練語言模型推理能力的強化學習方法。

## 完整說明

RLVR（Reinforcement Learning with Verifiable Rewards，可驗證獎勵強化學習）是一種針對大型語言模型的後訓練技術，其核心特點是使用能夠客觀驗證的獎勵信號來訓練模型，而非依賴人類主觀評分。典型場景包含數學題（答案正確與否可程式化驗證）、程式碼（程式能否通過測試案例）、邏輯推理等任務。RLVR 是 DeepSeek-R1 等近期強推理模型的關鍵訓練技術。

## 常見問題

### RLVR 和 RLHF 的主要差別是什麼？

最核心的差別在於獎勵信號的來源。RLHF 依賴人類標注者對模型輸出進行評分，然後訓練一個獎勵模型替代人類；RLVR 使用可程式化自動驗證的客觀獎勵（如數學答案正確與否），不需要人類評分員。RLHF 的優勢是適用範圍廣（任何有人類偏好的任務）；RLVR 的優勢是獎勵信號精確無噪音、可擴展到大規模訓練，且不存在獎勵模型被攻擊（reward hacking）的問題。目前強推理模型（如 DeepSeek-R1）以 RLVR 訓練數學和程式碼能力，對話品質則仍可能搭配 RLHF。

### RLVR 為什麼能提升模型的推理能力？

RLVR 的本質是給模型一個「探索空間」：面對同一道難題，模型嘗試多種不同的解題路徑，只有能得到正確答案的路徑才獲得正獎勵。透過強化學習不斷迭代，模型逐漸學習到哪些思維模式更有可能得出正確答案，即使是之前監督微調階段從未見過的解題策略也能被探索出來。這與 SFT 的「模仿已知答案」不同，RLVR 允許模型「發現」新的推理策略，這也是為什麼 RLVR 訓練的模型常能在超出訓練分布的難題上表現出色。

### RLVR 只能用在數學和程式碼嗎？其他領域也能用嗎？

目前 RLVR 的應用主要集中在有客觀答案的任務，確實以數學和程式碼為主。但研究社群正在探索將「可驗證性」擴展到更多領域：例如事實問答（答案可用知識庫驗證）、格式化資訊擷取（結構是否符合 schema）、以及某些邏輯推理任務。對於主觀性強的任務（如創意寫作、開放對話），目前較難直接應用 RLVR。一個新興方向是「LLM-as-Judge」結合 RLVR，用另一個強大的 LLM 作為自動驗證器，雖然引入了新的偏見風險，但擴大了 RLVR 的適用範圍。

---

來源：https://aiterms.tw/terms/rlvr-reinforcement-learning-with-verifiable-rewards
快查頁：https://aiterms.tw/terms/rlvr-reinforcement-learning-with-verifiable-rewards
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-rlvr-reinforcement-learning-with-verifiable-rewards