---
title: "資料偏誤（Data Bias）"
slug: data-bias
language: zh-TW
source: https://aiterms.tw/terms/data-bias
updated_at: 2026-07-30
tags: [AI 倫理, 公平性, 偏見, 訓練資料, 負責任 AI, 機器學習]
ipas_term: false
---

# 資料偏誤（Data Bias）

訓練資料中存在的系統性偏差，使模型對特定群體或情境產生不公平或不準確的預測結果，是 AI 公平性問題的主要根源之一。

## 完整說明

資料偏誤（Data Bias）是指訓練資料在蒐集、標記或組成上存在的系統性偏差，導致機器學習模型學到錯誤的規律，在特定群體（如性別、種族、年齡）或情境下做出不公平或不準確的預測。資料偏誤可分為歷史偏誤、抽樣偏誤、標記偏誤等多種類型，是 AI 倫理與公平性研究的核心議題。

## 常見問題

### 資料偏誤一定會導致不公平的模型嗎？

並非所有資料偏誤都必然導致不公平的模型輸出，但未被識別和處理的偏誤確實是 AI 不公平的主要根源之一。有些偏誤的影響可能微小或在業務情境中可接受；有些則可能對特定群體造成重大系統性傷害。關鍵在於針對具體應用場景進行子群體評估，明確定義公平性標準，並持續監控模型在不同族群上的表現，而不是假設資料和模型天然是公平的。

### 技術上有辦法完全消除資料偏誤嗎？

目前在技術上還沒有能完全消除資料偏誤的方法，主要原因有兩個：第一，不同公平性定義（人口統計平等、機會平等、個體公平等）在數學上往往相互衝突，無法同時滿足；第二，歷史偏誤源自現實世界的不平等，單靠技術手段無法從根本消除。技術方法（對抗去偏、公平性約束訓練、後處理校準等）能夠緩解偏誤的部分影響，但完善的解決方案還需要多元化的資料蒐集團隊、清晰的倫理政策和外部監管機制。

### 作為開發者，部署 AI 模型前應如何評估資料偏誤？

在部署前，開發者應系統性地執行以下步驟：首先分析訓練資料的子群體分佈，確認各受保護屬性（如性別、種族、年齡）在資料中是否有足夠的代表性；其次在測試集上分別計算各子群體的模型指標（準確率、FPR、FNR 等），比較是否存在顯著差異；再確認標注流程，評估標注者之間的一致性（Inter-annotator Agreement）；最後選擇適合業務場景的公平性定義，設定可接受的差距閾值，並在模型上線後持續監控各子群體的表現。

---

來源：https://aiterms.tw/terms/data-bias
快查頁：https://aiterms.tw/terms/data-bias
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-data-bias