---
title: "抽樣偏誤（Sampling Bias）"
slug: sampling-bias
language: zh-TW
source: https://aiterms.tw/terms/sampling-bias
updated_at: 2026-06-22
tags: [資料品質, 偏誤, 資料收集, AI公平性, 統計學]
ipas_term: false
---

# 抽樣偏誤（Sampling Bias）

資料收集過程中某些群體被系統性地過度或不足代表，導致樣本無法真實反映目標母體的問題。

## 完整說明

抽樣偏誤（Sampling Bias）是指在資料收集或樣本選取的過程中，因方法或流程的系統性缺陷，使得某些個體或群體比其他個體有更高或更低的機率被納入樣本，導致樣本統計特性偏離真實母體，進而使基於該樣本的統計推斷或機器學習模型產生系統性誤差。

## 常見問題

### 抽樣偏誤和測量偏誤有什麼不同？

兩者都是資料品質問題，但發生在不同環節。抽樣偏誤發生在「誰被納入樣本」的選取階段，問題是樣本結構不能代表母體，例如只訪問自願填問卷的人。測量偏誤則發生在「已選取的樣本如何被量測」的記錄階段，問題是對個體的測量或標記本身不準確，例如問卷問題設計誘導特定答案、醫療記錄對某些群體的診斷標準不一致。兩者都可能同時存在，都需要在資料清理與分析前仔細識別。機器學習中的訓練資料可能同時受到抽樣偏誤（哪些用戶的資料被收集）和測量偏誤（標注者的主觀偏差）影響。

### 存活者偏誤在商業決策中是如何出現的？

存活者偏誤在商業場景中非常普遍。創業成功案例研究是典型例子：商業書籍和媒體大量報導成功企業家的特質和決策，但未能成功的創業者有同樣的特質卻失敗了，這些案例幾乎從不被記錄。導致讀者誤以為「早起、堅持、差異化定位」是成功的充分條件。另一個例子是投資基金績效評估：只看現存基金的歷史報酬，但已清算的虧損基金不在比較集合內，整體市場的「平均報酬」被高估。在機器學習中，若只用成功完成交易的用戶資料訓練推薦系統，而忽略中途放棄的用戶，系統將學不到放棄行為的信號，導致推薦結果不能有效降低用戶流失。

### 如何在資料收集階段預防抽樣偏誤？

預防抽樣偏誤最有效的時機是在資料收集設計階段。首先，清楚定義目標母體，明確「希望模型服務的對象是誰」，並確保收集計畫能覆蓋這個群體的所有重要子群。其次，使用機率抽樣方法（如分層隨機抽樣），確保各子群按既定比例被抽取，而非依賴便利樣本（如只向現有用戶發問卷）。第三，記錄資料收集的完整 metadata（時間、地點、管道、排除條件），方便事後審計偏誤來源。第四，定期比較收集到的樣本分布與已知母體分布（如人口普查資料），若有明顯偏差及早調整收集策略。最後，對於高風險 AI 系統，建議在資料收集前進行多元利害關係人審查，識別可能被邊緣化的群體並制定主動納入策略。

---

來源：https://aiterms.tw/terms/sampling-bias
快查頁：https://aiterms.tw/terms/sampling-bias
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-sampling-bias