---
title: "等寬分箱（Equal-Width Binning）"
slug: equal-width-binning
language: zh-TW
source: https://aiterms.tw/terms/equal-width-binning
updated_at: 2026-07-30
tags: [特徵工程, 資料前處理, 離散化, 分箱, 機器學習, 資料科學]
ipas_term: false
---

# 等寬分箱（Equal-Width Binning）

將連續型數值特徵依等距區間分割成有限個離散類別的資料前處理技術。

## 完整說明

等寬分箱（Equal-Width Binning）是一種資料離散化方法，將連續型數值特徵的取值範圍平均劃分為 k 個寬度相等的區間，再將每個數值歸入所屬區間，轉換成對應的類別標籤或整數索引。每個區間（箱）的寬度計算方式為：（最大值 - 最小值）/ k。這是最直觀的分箱策略，但對離群值與分佈不均的資料較為敏感。

## 常見問題

### 等寬分箱（Equal-Width）和等頻分箱（Equal-Frequency）應該怎麼選？

選擇依據主要是資料的分佈形狀。若特徵值分佈接近均勻分佈或常態分佈，等寬分箱通常足夠；但若資料高度偏斜（如收入、用戶活躍天數等呈長尾分佈），等寬分箱會導致大多數樣本集中在少數箱中，此時等頻分箱更合適，因為它保證每箱的資訊量相似。此外，若需要對業務方解釋分箱含義（如「年齡 20-40 歲為一組」），等寬分箱的語意更直觀；若只看重模型性能，等頻分箱往往效果更穩定。

### 進行等寬分箱前需要先處理離群值嗎？

強烈建議在等寬分箱前先處理離群值。等寬分箱的區間寬度是用最大值減最小值除以箱數計算的，如果資料中存在極端離群值，整個取值範圍會被大幅拉伸，導致正常範圍的資料被擠壓到少數幾個箱中，而大量箱用於覆蓋那些幾乎沒有樣本的極端區域。常見的預處理方式包括：先對特徵進行截尾（Winsorization，例如將超過第 99 百分位的值截斷至第 99 百分位），或移除離群值後再進行分箱，這樣分箱結果會更有意義。

### 等寬分箱之後，轉換出來的類別標籤還需要進行獨熱編碼嗎？

這取決於後續使用的模型類型。若下游模型是決策樹、隨機森林等對標籤數值大小不敏感的模型，直接使用整數標籤（1、2、3...）是合理的，模型可以自己找到分割點。若使用的是線性模型（如邏輯迴歸）或支援向量機，應避免直接用整數標籤，因為這會讓模型誤認為箱 3 是箱 2 的兩倍，帶入虛假的序數關係。此時應進行獨熱編碼（One-Hot Encoding）將每個箱變成一個二元特徵。scikit-learn 的 KBinsDiscretizer 支援 encode='onehot' 參數，可直接輸出獨熱編碼形式。

---

來源：https://aiterms.tw/terms/equal-width-binning
快查頁：https://aiterms.tw/terms/equal-width-binning
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-equal-width-binning