---
title: "階層式密度分群演算法（Hierarchical DBSCAN）"
slug: hierarchical-dbscan
language: zh-TW
source: https://aiterms.tw/terms/hierarchical-dbscan
updated_at: 2026-06-22
tags: [機器學習, 統計方法, 資料處理, 異常偵測]
ipas_term: false
---

# 階層式密度分群演算法（Hierarchical DBSCAN）

階層式密度分群演算法（Hierarchical DBSCAN, HDBSCAN）是 DBSCAN 的進化版本，透過建立多密度尺度的階層式叢集樹，能自動適應密度不均勻的資料，無需設定全局鄰域半徑 ε，並

## 完整說明

階層式密度分群演算法（HDBSCAN）解決了 DBSCAN 需要全局固定 ε 的根本問題。HDBSCAN 透過計算每個點的「核心距離（Core Distance）」和「互達距離（Mutual Reachability Distance）」建立最小生成樹，再從中提取在不同密度尺度下穩定存在的叢集，以「叢集穩定性（Cluster Stability）」為準則自動決定最終分群。相較於 DBSCAN，HDBSCAN 能同時偵測稀疏和密集的群組，並為每個資料點提供所屬叢集的概率（Soft Clustering），是目前工業界最常用的密度分群演算法之一。

## 常見問題

### HDBSCAN 和 DBSCAN 在 iPAS 考題中如何區分？

iPAS 考題區分兩者的關鍵線索在題目描述中：若提到「資料中不同群組密度差異很大」「不希望手動設定 ε」「需要知道每個點屬於叢集的信心程度（軟分群）」，答案通常是 HDBSCAN。若提到「已知 ε 和 minPts 兩個參數」「需要識別雜訊點」「分群形狀不規則但密度相對均勻」，答案通常是 DBSCAN。記憶方式：HDBSCAN 的 H 代表 Hierarchical（階層），它透過建立密度層次樹來自動適應不均勻密度，是 DBSCAN 的進化版本，解決了 DBSCAN 需要全局固定 ε 的根本限制。

### 為什麼 HDBSCAN 常與 UMAP 搭配使用？

HDBSCAN 基於歐氏距離計算密度，在高維空間中受維度詛咒影響：所有點之間的距離趨於相等，密度概念失去意義，叢集邊界模糊。UMAP（Uniform Manifold Approximation and Projection）是一種強大的非線性降維方法，能夠在保留高維資料的局部拓撲結構的同時大幅降低維度（通常降至 2–50 維），使密度分群在低維嵌入空間中更有效。UMAP + HDBSCAN 已成為自然語言嵌入聚類（如 BERTopic）、單細胞資料分析和高維異常偵測的標準組合，兩者在演算法設計上也使用了相容的數學框架（流形假設）。

### HDBSCAN 的 Soft Clustering 輸出如何解讀？

HDBSCAN 的軟分群輸出為每個資料點提供一個概率向量，各元素代表該點屬於每個叢集的概率。解讀方式：概率接近 1.0 的點是叢集的核心成員，預測非常確定；概率在 0.3–0.7 之間的點位於叢集邊緣或多個叢集的交界處，預測存在不確定性；所有叢集概率都很低（如最高僅 0.1）的點，HDBSCAN 認定其為雜訊點。在實際應用中，可將概率低於閾值（如 0.05）的點視為雜訊，對邊界點（概率 0.3–0.7）進行人工審查或標記為「待確認」類別，特別適合醫療診斷或金融欺詐等需要處理不確定性的場景。

---

來源：https://aiterms.tw/terms/hierarchical-dbscan
快查頁：https://aiterms.tw/terms/hierarchical-dbscan
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-hierarchical-dbscan