---
title: "分布偏移（Distribution Shift）"
slug: distribution-shift
language: zh-TW
source: https://aiterms.tw/terms/distribution-shift
updated_at: 2026-07-30
tags: [模型部署, MLOps, 資料漂移, 模型監控, 生產環境]
ipas_term: false
---

# 分布偏移（Distribution Shift）

模型訓練時的資料分布與部署後實際遇到的資料分布不同，導致模型效能下降的現象。

## 完整說明

分布偏移（Distribution Shift）又稱資料漂移（Data Drift），指機器學習模型在訓練階段所用資料的統計分布，與模型實際部署後面對的輸入資料分布存在差異。這種差異會使模型在生產環境中的表現顯著不如訓練或測試時的水準，是機器學習系統在真實世界部署中失效的主要原因之一。

## 常見問題

### 如何在沒有標籤的情況下偵測生產環境中的分布偏移？

在生產環境中，新資料往往沒有即時標籤（如詐騙偵測需要等案件確認）。此時只能監控輸入特徵 X 的分布。常用方法包括：使用 Kolmogorov-Smirnov 檢定比較特徵的統計分布差異；計算 Population Stability Index（PSI）衡量每個特徵的分布穩定性；監控模型預測值分布（預測機率的均值、方差）是否異常；利用無監督方法如 Autoencoder 偵測輸入重建誤差的增加。這些方法都是間接指標，發現異常應盡快獲取標籤（加速人工標注或等待自然標籤）以確認是否真的影響模型效能。

### 概念漂移和共變量偏移有什麼實際差別？

兩者的差別在於「是輸入變了，還是輸入和輸出的關係變了」。共變量偏移：輸入 X 的分布改變，但 X 決定 Y 的機制不變，例如評論分類模型在不同語言或領域的文章上使用，輸入文字風格變了，但正負評論的語言特徵與情感的對應關係沒變。概念漂移：X 與 Y 的關係本身改變，例如「免費試用」這個詞在某時期是詐騙廣告的高頻詞，但後來合法服務也大量使用，同樣的詞語不再是詐騙的信號。對付共變量偏移可以靠加權或遷移學習；概念漂移則通常需要重新採集標籤並重新訓練模型。

### 多久應該重新訓練一次模型？

沒有固定答案，取決於資料的變化速度與業務容忍度。一些高頻變化的場景（如廣告點擊率預測、詐騙偵測）可能每天甚至每小時需要更新；變化緩慢的場景（如工廠設備壽命預測）每季或每年重訓一次可能就足夠。實務上建議採用監控驅動的策略：設置效能指標的警報閾值（如 AUC 下降超過 3%），或特徵分布偏移指標的閾值（如 PSI > 0.25），觸發時自動啟動重訓流程，而非按固定週期盲目重訓。同時應維護一條快速重訓流水線（ML Pipeline），確保偵測到偏移後能在數小時內完成重訓和部署。

---

來源：https://aiterms.tw/terms/distribution-shift
快查頁：https://aiterms.tw/terms/distribution-shift
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-distribution-shift