---
title: "梯度累積（Gradient Accumulation）"
slug: gradient-accumulation
language: zh-TW
source: https://aiterms.tw/terms/gradient-accumulation
updated_at: 2026-06-22
tags: [模型訓練, 最佳化, 神經網路, 深度學習]
ipas_term: false
---

# 梯度累積（Gradient Accumulation）

多個訓練步驟內累加梯度，最後進行一次參數更新，有效增加批量大小而不增加記憶體占用，用於訓練記憶體受限的大型模型。

## 完整說明

Gradient Accumulation 是一種記憶體優化技術，通過多次前向傳播和反向傳播來累積梯度，然後進行單次參數更新。這樣可以在記憶體有限的情況下，實現使用更大批量大小的效果，改善模型收斂效果，同時保持計算成本的線性增長。

## 常見問題

### 如何確定合適的梯度累積步數？

累積步數應使得有效批量（小批量 * 累積步數）達到目標大小。若 GPU 只容納 256 的批量但目標 1024，則累積步數 = 1024 / 256 = 4。選擇時應平衡：累積步數過小，記憶體優化效果有限；過大，訓練時間顯著增加（線性關係）。實踐中，4-8 是常見選擇，取決於可接受的訓練時間增加。

### 梯度累積時是否需要調整優化器的超參數？

通常不需要調整優化器超參數（如學習率、β1、β2 等），因為有效批量和梯度大小都通過損失分縮放來維持。但應注意梯度剪裁（若使用）應在累積後應用，而不是每步應用。此外，如果同時使用動量或其他累積機制，要確保不重複累積。大多數框架的優化器自動處理這些細節。

### 梯度累積是否改變訓練的收斂行為？

梯度累積本身不應改變收斂行為，因為最終梯度相同。但在實踐中，由於訓練軌跡不同（更新頻率降低），可能導致略微不同的收斂曲線。若超參數不調整，可能出現幾個百分點的性能差異，但這通常是由於批量大小效應，而非累積本身。在大批量訓練中常見的一個現象是需要提高學習率以匹配大批量的梯度幅度。

---

來源：https://aiterms.tw/terms/gradient-accumulation
快查頁：https://aiterms.tw/terms/gradient-accumulation
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-gradient-accumulation