人類回饋強化學習(RLHF)是一種利用人類回饋訊號,訓練強化學習模型,使其行為更符合人類偏好的方法。
容易混淆
RLHF vs 獎勵建模
RLHF 是整個流程 獎勵建模是流程中的一個環節 最關鍵的區別是全流程和其中一步。
RLHF vs 監督式微調
RLHF 用人類偏好與強化學習更新模型 監督式微調主要是拿標準答案直接學 最關鍵的區別是學答案還是學偏好。
記住這句就好
先學人喜歡什麼,再把模型往那裡推。
實際案例
對話助理 先收集人類對多個回答的偏好,再讓模型學會更有幫助、比較安全的回覆方式。
摘要系統 如果使用者偏好簡短、準確、沒廢話的答案,RLHF 可以把這些偏好帶進模型。
算法與應用
典型流程是蒐集偏好資料、訓練 reward model、再用強化學習更新語言模型。 它的目標不是只讓模型更聰明,而是讓它更符合人類使用習慣。 成本高、資料貴、流程長,是它最常見的代價。
三個階段拆開看
| 階段 | 在做什麼 | 產出 |
|---|---|---|
| 監督式微調(SFT) | 用人寫的示範答案做一般微調 | 一個會照格式回答的基礎模型 |
| 獎勵模型訓練(RM) | 人類對同一題的多個回答排序,訓練一個會打分的模型 | 一個能預測「人比較喜歡哪個」的評分器 |
| 強化學習微調(PPO 等) | 讓語言模型去最大化獎勵模型給的分數 | 對齊過的最終模型 |
三個階段缺一不可,但真正花錢的是第二階段的人工排序。獎勵模型的品質直接決定最終模型的上限,因為第三階段是拿獎勵模型當老師,老師打分不準,學生就往錯的方向跑。
第三階段一定會加一個 KL 散度懲罰項,限制新模型不要離 SFT 模型太遠。沒有這個限制,模型會找到獎勵模型的漏洞,產出分數很高但實際很怪的答案,這叫獎勵駭客(reward hacking)。
考題會怎麼問
這個詞在考題裡出現,通常是四選一的形式,題幹描述「人類針對模型輸出給回饋,模型據此調整」,選項會放預訓練、微調、RLHF、向量化。判準只有一句:有沒有人類的偏好回饋參與訓練迴路。
預訓練:只有大量文字,沒有人在旁邊評價,學的是預測下一個字。
微調(fine-tuning):有標準答案,但沒有「比較哪個比較好」這件事。
RLHF:有人類針對多個輸出排序或評分,而且這個回饋被拿去更新模型。
向量化:把文字轉成數字表示,跟訓練回饋無關。
另一種常考的問法是「RLHF 的目的主要是什麼」,答案是讓模型輸出更符合人類偏好與安全期待,不是讓模型知識更多,也不是讓模型跑更快。
常見的替代做法
DPO(Direct Preference Optimization,直接偏好最佳化):跳過訓練獎勵模型與強化學習,直接用偏好資料對,以一個分類式的損失函數更新模型。流程短很多、比較穩定,是近年常見的替代路線。
RLAIF(人工智慧回饋強化學習):把「人類排序」換成「另一個模型排序」,成本大幅下降,代價是把評分模型的偏誤一起學進來。
憲法式 AI(Constitutional AI):先寫一組原則,讓模型依原則自我批改,再拿修正後的資料訓練。同樣是為了減少人力標註。
情境判斷
Q1(直覺題):如果模型先看人類對回答的排序偏好,再調整自己的輸出,這是什麼?
→ 這就是 RLHF。
Q2(判斷題):只要做了 RLHF,模型就不會出現危險回答嗎?
→ 不能保證。它能改善對齊,但仍要搭配安全規則、測試和監控。
閱讀這頁時的常見誤區
只背中英文對照,無法判斷術語的適用情境。先確認定義,再對照完整說明與相關概念,頁面中的考試比重或出題方向,必須和下方標示的資料來源一起閱讀。
相關術語
常見問題
RLHF 中如何確保人類回饋品質?
A:要靠清楚標準、標註訓練和一致性檢查,不是隨便打分就行。
RLHF 的成本高嗎?
A:通常很高,因為它需要大量偏好資料和多階段訓練。
RLHF 可以用在所有 AI 系統嗎?
A:不一定,只有在「人類偏好很重要」的任務裡,投資才比較值得。
資料來源
- AITerms.tw 術語資料庫,最後更新:2026-07-29。