---
title: "餘弦退火（Cosine Annealing）"
slug: cosine-annealing
language: zh-TW
source: https://aiterms.tw/terms/cosine-annealing
updated_at: 2026-06-22
tags: [模型訓練, 最佳化, 神經網路, 深度學習]
ipas_term: false
---

# 餘弦退火（Cosine Annealing）

學習率沿著餘弦函數曲線逐漸衰減，從初始值平滑降低到最小值，使模型在訓練後期細微調整參數。

## 完整說明

Cosine Annealing 是一種學習率衰減策略，按照餘弦函數的形狀逐漸降低學習率。與階梯式衰減不同，餘弦退火提供了平滑的、連續的學習率變化。它在訓練初期保持相對較大的學習率，在訓練中後期快速衰減，到訓練末期逼近零，實現了對學習率的精細控制。

## 常見問題

### 如何確定 cosine annealing 的最小學習率（lr_min）？

lr_min 的選擇影響訓練末期的微調程度。通常 lr_min 設為 lr_max 的 1/100 到 1/10000。常見做法是 lr_min = 0 或 lr_min = lr_max * 0.0001。如果設置過大，末期難以精細調整；設置過小，末期梯度更新幾乎停止。實踐中可以嘗試不同值，觀察驗證曲線的最終性能。

### 如何將 cosine annealing 應用於多階段訓練？

多階段訓練（如微調不同層）可以為各階段分別設定 cosine annealing。每個階段有自己的 lr_max、lr_min 和衰減周期。例如，第一階段微調尾層（100 個 epoch），第二階段微調全網路（50 個 epoch），每階段各用獨立的 cosine 衰減。這需要在代碼中設定階段切換點和相應的學習率參數。

### 為什麼 cosine annealing 比恆定學習率或簡單衰減更好？

恆定學習率會導致訓練末期在最小值周圍震蕩，難以精確收斂。簡單的階梯衰減產生不連續跳躍，可能導致損失函數波動。Cosine annealing 提供平滑的連續衰減，讓模型逐漸調整到更精細的搜索，在末期能達到更好的局部最小值。實驗數據表明，cosine annealing 通常將最終準確度提高 0.5-2%。

---

來源：https://aiterms.tw/terms/cosine-annealing
快查頁：https://aiterms.tw/terms/cosine-annealing
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-cosine-annealing