---
title: "探索性資料分析（Exploratory Data Analysis）"
slug: exploratory-data-analysis
language: zh-TW
source: https://aiterms.tw/terms/exploratory-data-analysis
updated_at: 2026-07-29
tags: [資料處理, 特徵工程, 統計方法, source:ipas]
ipas_term: true
---

# 探索性資料分析（Exploratory Data Analysis）

在機器學習建模前，透過視覺化與統計方法理解資料特徵、發現模式並檢驗假設的關鍵資料處理步驟。

## 完整說明

探索性資料分析是一種在進行正式模型訓練前對資料集進行初步調查的方法，用於發掘資料的潛在結構、異常值與變數關聯。常見應用包括特徵工程的前期作業、資料清洗與商業智慧分析。

## iPAS 考試出題分析

屬於未分類考範圍。

## 常見問題

### 為什麼不直接把資料丟進 AutoML 工具，還需要做 EDA？

雖然現今的 AutoML 工具非常強大，能自動處理缺失值並尋找最佳超參數，但它們缺乏對真實業務邏輯的理解。EDA 不僅僅是看統計數字，更是將資料與現實世界對齊的過程。透過 EDA，我們可能會發現極端值其實是感測器故障造成，或變數間存在不合理的資料洩漏。若未經 EDA 直接訓練，容易產出實務上不可用的模型，這正是垃圾進，垃圾出的典型寫照。

### EDA 階段最常用的圖表有哪些？各適用於什麼情境？

EDA 中有四種圖表不可或缺：1. 直方圖與密度圖：觀察單一連續變數分佈形狀，判斷是否為常態分佈。2. 箱型圖：快速定位變數的四分位距與明顯的離群值。3. 散佈圖：觀察兩個連續變數之間的相關性與資料叢集趨勢。4. 熱力圖：展示特徵間的相關係數矩陣，幫助我們在特徵選擇階段排除高度共線性的冗餘特徵。這四者構成了探索性資料分析的最核心視覺化工具。

### EDA 通常會花費資料科學家多少時間？

在業界的實際機器學習專案中，EDA 與相伴隨的資料清洗、特徵工程往往佔據資料科學家高達六至八成的時間。大眾常誤以為建立複雜的神經網路架構才是核心。然而，了解資料特性、處理缺失值、編碼變數以及發掘深藏背後的商業洞見，才是決定模型最終成敗的底層工作。EDA 做得越紮實，後續的模型訓練與參數調優就會越順利，產出的預測結果在實務上也更具解釋性。

---

來源：https://aiterms.tw/terms/exploratory-data-analysis
快查頁：https://aiterms.tw/terms/exploratory-data-analysis
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-exploratory-data-analysis