---
title: "模型選擇（Model Selection）"
slug: model-selection
language: zh-TW
source: https://aiterms.tw/terms/model-selection
updated_at: 2026-06-22
tags: [模型評估, 機器學習工作流, 超參數調整, AutoML]
ipas_term: false
---

# 模型選擇（Model Selection）

從多個候選機器學習模型中，依評估指標與驗證策略選出泛化能力最佳的決策過程。

## 完整說明

模型選擇（Model Selection）是機器學習工作流程中的關鍵環節，涵蓋演算法類型選擇、超參數調整與驗證策略設計，目標是找出在未見過的新資料上表現最好的模型。

## 常見問題

### 模型選擇時最嚴重且最常犯的錯誤是什麼？

最嚴重的是「測試集洩漏（Data Leakage）」：在模型選擇過程中誤用了測試集的資訊。常見情形包括：用測試集選超參數（導致超參數過擬合測試集）、資料預處理時用了包含測試集資料計算的統計量（如 StandardScaler 用全資料計算均值和標準差，測試集的分布資訊洩漏給了訓練過程）、或在早期探索階段多次查看測試集結果。正確做法是將測試集嚴格封存，只在所有模型選擇決定都最終確定後才開封評估一次，且只能用一次。

### K=5 和 K=10 的 Cross-Validation 有什麼具體差別？

K=5 和 K=10 是最常用的兩個選擇，分別代表不同的偏差-方差取捨。K=5 時每次訓練集佔總資料的 80%，計算成本適中，適合資料量中等或大的場景；K=10 時每次訓練集佔 90%，評估偏差更低（訓練集更大，模型更接近最終版本），但計算成本是 K=5 的兩倍，各折之間的重疊更多使得方差估計略有問題。實證研究（如 Kohavi 1995）顯示在大多數資料集上 K=10 的偏差-方差平衡優於 K=5。資料集很小時（<100 筆），可考慮 Leave-One-Out CV（K=n），但計算成本極高。

### 如何在多個效能相近的模型中做最終選擇？

當多個模型的驗證指標差異落在統計誤差範圍內（用 paired t-test 或 Wilcoxon signed-rank test 確認無統計顯著差異），應引入次要標準：1）推論延遲，線上服務對響應速度有嚴格要求，100ms 大型模型 vs. 5ms 輕量模型是不同的取捨；2）可解釋性，金融、醫療等高風險應用受法規要求（如 GDPR 的可解釋性規定）；3）維護成本，深度神經網路需要更多算力、更多工程人員、更頻繁的重訓；4）訓練穩定性，能否在新資料上快速重訓並得到可靠結果。「夠好且可維護」往往比「邊際最佳但難維護」更有長期價值。

---

來源：https://aiterms.tw/terms/model-selection
快查頁：https://aiterms.tw/terms/model-selection
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-model-selection