---
title: "隨機過採樣（Random Oversampling）"
slug: random-oversampling
language: zh-TW
source: https://aiterms.tw/terms/random-oversampling
updated_at: 2026-06-22
tags: [機器學習, 資料處理, 模型訓練, 統計方法]
ipas_term: false
---

# 隨機過採樣（Random Oversampling）

隨機過採樣（Random Oversampling）是處理類別不平衡問題的技術，透過隨機複製少數類別的現有樣本，使各類別的訓練樣本數趨於平衡，讓模型對少數類別有足夠的學習機會，但有增加過擬合風險的疑慮

## 完整說明

隨機過採樣（Random Oversampling）是解決類別不平衡（Class Imbalance）問題的基礎方法之一，直接隨機複製少數類別（Minority Class）的樣本，直到各類別數量達到目標比例。其優點是實作簡單、不引入任何合成資訊，但缺點是重複樣本可能導致模型過擬合，因為模型會對同一個點的特徵記憶多次。常與隨機欠採樣（Random Undersampling）或 SMOTE 等進階方法並比，適合作為不平衡問題的基線解法。

## 常見問題

### 過採樣應該在交叉驗證的哪個階段執行？

必須在每個交叉驗證折的訓練集內部執行，不能在切割折之前對整體訓練資料執行。若提前執行過採樣，訓練集與驗證集可能共享完全相同的複製樣本，導致驗證集的評估分數虛高（這是一種資料洩漏）。正確做法是使用 imbalanced-learn 的 Pipeline 包裹過採樣步驟，Pipeline 會確保 fit_resample 只在每一折的訓練部分被呼叫，驗證折保持未被修改的狀態。

### 隨機過採樣和 SMOTE 的主要差異是什麼？

隨機過採樣直接複製現有的少數類別樣本，訓練集中出現重複的資料點，模型可能因此在這些特定點上過擬合。SMOTE（Synthetic Minority Over-sampling Technique）在少數類別的近鄰樣本之間進行線性插值，生成全新的合成樣本，增加了少數類別的多樣性，通常能帶來更好的泛化效果。然而，SMOTE 在高維稀疏空間（如文字的 TF-IDF 表示）中插值可能產生無意義的點，此時隨機過採樣反而更安全。

### 不平衡問題除了過採樣，還有哪些常見解法？

主要有四類解法：一是採樣策略，包含過採樣（增加少數類）和欠採樣（減少多數類）；二是演算法層面的類別權重，大多數 Scikit-learn 模型支援 class_weight='balanced'，直接在損失函數中放大少數類的懲罰，無需修改資料；三是調整決策門檻，將二元分類的輸出機率門檻從 0.5 下調（如 0.3），以提高少數類召回率；四是使用對不平衡較不敏感的演算法，如集成方法中的 BalancedRandomForest 或 EasyEnsemble。類別權重調整通常是最快速的基線解法，可優先嘗試。

---

來源：https://aiterms.tw/terms/random-oversampling
快查頁：https://aiterms.tw/terms/random-oversampling
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-random-oversampling