---
title: "嶺迴歸（L2 正則化迴歸）（Ridge Regression）"
slug: ridge-regression
language: zh-TW
source: https://aiterms.tw/terms/ridge-regression
updated_at: 2026-07-30
tags: [機器學習, 正則化, 監督學習, 線性迴歸, 多元共線性]
ipas_term: false
---

# 嶺迴歸（L2 正則化迴歸）（Ridge Regression）

在線性迴歸損失函數中加入 L2 懲罰項以限制係數大小，防止過擬合的監督學習方法。

## 完整說明

嶺迴歸（Ridge Regression）是線性迴歸的正則化版本，透過在均方誤差損失中加入所有迴歸係數的平方和（L2 懲罰項），使模型係數向零收縮但不完全為零。此方法由 Hoerl 與 Kennard 於 1970 年提出，主要用於解決多元共線性問題，以及在高維度資料下防止過擬合，提升模型在未見資料上的泛化能力。

## 常見問題

### 嶺迴歸中的 λ 越大越好嗎？

不是。λ 是控制正則化強度的超參數，過小（趨近 0）等同普通線性迴歸，模型可能過擬合；過大則所有係數都被壓縮到接近零，模型失去預測能力，變成欠擬合。最佳的 λ 值需要透過交叉驗證在訓練集上搜索，選擇在驗證集上表現最好的值。實際應用中，偏誤與方差的權衡（Bias-Variance Tradeoff）決定了最佳 λ 的位置：λ 增大時偏誤上升、方差下降，最優點通常在兩者的折衷處。

### 嶺迴歸和 Lasso 應該怎麼選？

選擇取決於特徵結構與需求。若懷疑大多數特徵都與目標有關聯，嶺迴歸更適合，它保留所有特徵並均衡壓縮係數。若懷疑只有少數特徵真正有用，且希望模型有特徵選擇能力（稀疏解），Lasso 更合適。若不確定，Elastic Net（兼具 L1 和 L2）通常是保守的折衷選擇。多元共線性嚴重的情況下，Lasso 會隨機保留相關特徵中的一個，可能不穩定；此時嶺迴歸能對相關特徵均勻分配係數，更為穩健。

### 使用嶺迴歸前需要對特徵做標準化嗎？

是的，標準化（或歸一化）是使用嶺迴歸前的重要前處理步驟。這是因為 L2 懲罰項對所有係數的平方一視同仁，如果不同特徵的數值尺度差異很大（例如收入以千元計、年齡以個位數計），數值大的特徵對應的係數天然較小，懲罰對它的影響也較小，導致正則化效果不均衡。將所有特徵標準化為零均值、單位標準差（StandardScaler）後，正則化才能公平地對所有特徵施加相同量級的壓縮。sklearn 的 `Ridge` 在 `fit_intercept=True` 時會自動處理截距，但特徵本身仍需用戶手動標準化。

---

來源：https://aiterms.tw/terms/ridge-regression
快查頁：https://aiterms.tw/terms/ridge-regression
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-ridge-regression