---
title: "吉尼不純度（Gini Impurity）"
slug: gini-impurity
language: zh-TW
source: https://aiterms.tw/terms/gini-impurity
updated_at: 2026-07-30
tags: [決策樹, 機器學習, 分類, CART, 特徵選擇]
ipas_term: false
---

# 吉尼不純度（Gini Impurity）

衡量資料集標籤混雜程度的指標，常用於決策樹的分裂準則，值越低表示越純淨。

## 完整說明

吉尼不純度（Gini Impurity）是分類問題中衡量資料集標籤混雜程度的統計指標，數學上定義為從資料集中隨機抽取一個樣本、並依類別分佈隨機猜測其標籤時，猜錯的機率。決策樹演算法（如 CART）在每個節點選擇分裂特徵與閾值時，以最小化子節點加權吉尼不純度為目標，使得分裂後的子集合盡可能只包含單一類別的樣本。

## 常見問題

### 吉尼不純度和熵（資訊增益）有什麼實際差異？

吉尼不純度（Gini = 1 - Σp_i²）和熵（H = -Σp_i·log₂p_i）都衡量節點標籤的混雜程度，在選擇分裂特徵方面大多數情況下得到相同的結果。主要差異有三點。第一是計算速度：吉尼不純度只需要平方運算，比熵的對數運算更快，因此 scikit-learn 等框架預設使用吉尼。第二是數值範圍：吉尼不純度在 [0, 1-1/K] 之間（K 為類別數），熵在 [0, log₂K] 之間。第三是邊界行為：在接近純淨節點時，吉尼不純度的下降比熵更平緩，使得吉尼在某些資料上會偏好更大的子樹（分裂次數更多）；而熵對罕見類別更敏感（因對數函數在 p 趨近 0 時急劇下降），有時能產生更能區分少數類的分裂。對大多數實際應用而言，兩者的模型效能差異可以忽略不計，選擇哪個更多是計算效率的考量。

### 如何手動計算一個節點的吉尼不純度？

計算步驟如下。首先統計節點中每個類別的樣本數量，計算各類別的佔比 p_i（各類別樣本數除以節點總樣本數）。然後計算每個 p_i 的平方值 p_i²。最後用 1 減去所有 p_i² 的總和，即得到吉尼不純度。舉例說明：假設一個節點有 10 個樣本，其中 7 個屬於類別 A，3 個屬於類別 B。p_A = 7/10 = 0.7，p_B = 3/10 = 0.3。Gini = 1 - (0.7² + 0.3²) = 1 - (0.49 + 0.09) = 1 - 0.58 = 0.42。若分裂後左子節點 6 個全屬類別 A（Gini = 0），右子節點 4 個（1 個 A、3 個 B，Gini = 1 - (0.25 + 0.5625) = 0.375×...）：考生在 iPAS 考題中應能完成此類計算並比較不同分裂方案的加權吉尼值。

### 吉尼不純度在 iPAS 考試中的出題重點是什麼？

根據 114-2-mid-2 與 114-2-mid-3 的出題模式，吉尼不純度的考題主要有兩類。第一類是計算題：給定一個節點的類別分佈（如「正例 60 個，負例 40 個」），要求計算吉尼不純度的數值，或給定兩種分裂方案的子節點分佈，要求計算加權吉尼不純度並選出較佳方案。第二類是概念辨別題：要求考生區分吉尼不純度與資訊增益（熵）的公式與適用場景，或說明吉尼不純度在 CART 演算法中的角色。考生應確保能記住公式 Gini = 1 - Σ(p_i²)、理解「吉尼為 0 = 節點完全純淨」的邊界條件，以及了解吉尼不純度在隨機森林等集成學習方法中仍被沿用的事實。練習手動計算 2-3 個不同分佈節點的吉尼值，是應對計算題的有效準備。

---

來源：https://aiterms.tw/terms/gini-impurity
快查頁：https://aiterms.tw/terms/gini-impurity
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-gini-impurity