---
title: "均方根傳播（RMSProp）"
slug: rmsprop
language: zh-TW
source: https://aiterms.tw/terms/rmsprop
updated_at: 2026-06-22
tags: [模型訓練, 最佳化, 神經網路, 深度學習]
ipas_term: false
---

# 均方根傳播（RMSProp）

使用梯度平方的指數加權移動平均調整學習率的最佳化演算法，改進了 AdaGrad 學習率單調遞減的問題。

## 完整說明

RMSProp（Root Mean Square Propagation）是一種改進的自適應學習率最佳化演算法，由 Hinton 提出。它使用梯度平方的指數加權移動平均（EMA）而非累積和，保留最近梯度的影響，淡化歷史梯度的影響。這解決了 AdaGrad 學習率無限衰減的問題，使訓練能夠保持穩定的學習進度。

## 常見問題

### RMSProp 中衰減率 ρ 應該如何選擇？

衰減率 ρ 是 RMSProp 最重要的超參數。常見的推薦值是 0.9 或 0.99。較大的 ρ（如 0.99）保留更長的歷史，使學習率變化更平滑但可能反應遲鈍。較小的 ρ（如 0.9）更快適應新梯度變化，但可能波動較大。實踐中應基於驗證集表現調整，通常需要小範圍實驗（0.85 至 0.999）。

### 為什麼 RMSProp 比 AdaGrad 更適合長期訓練？

AdaGrad 累積梯度平方，隨著訓練進行，這個累積值會變得非常大，導致學習率趨近於零，訓練在後期幾乎停止。RMSProp 使用指數加權移動平均，只記住最近的梯度信息，不會無限增長。這使得學習率在長期訓練中能保持相對穩定，模型能夠持續學習。

### RMSProp 如何處理稀疏梯度？

在面對稀疏梯度時，RMSProp 的表現取決於衰減率設定。當某些參數長期不更新時，其移動平均會逐漸衰減，但不會完全消失。這比 AdaGrad 的完全累積更靈活，但仍可能出現稀有特徵學習困難的問題。在實踐中，可以調整衰減率或學習率來平衡稀疏特徵的學習。

---

來源：https://aiterms.tw/terms/rmsprop
快查頁：https://aiterms.tw/terms/rmsprop
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-rmsprop