---
title: "資料與數據（Data）"
slug: data
language: zh-TW
source: https://aiterms.tw/terms/data
updated_at: 2026-06-27
tags: [資料處理, 特徵工程, 自監督學習, AI基礎, source:arxiv]
ipas_term: false
---

# 資料與數據（Data）

資料是機器學習模型的學習基礎，包含結構化與非結構化形式，驅動 AI 系統發展。

## 完整說明

資料是一種承載真實世界資訊的數位實體形式，用於訓練與驗證人工智慧模型，使其能夠從中自動萃取特徵並學習隱藏規律。常見應用包括所有機器學習與深度學習任務，如電腦視覺、自然語言處理與大型基礎模型的預訓練。

## 常見問題

### 在資料量不足的情況下，有什麼策略可以訓練深度學習模型？

當資料量匱乏時，最有效的策略是遷移學習。可以先下載在大型公開資料集上預訓練好的模型，鎖定底層萃取特徵的權重，只利用手上少量的資料微調最後的分類層。其次是大量使用資料擴增技術，對現有圖片進行翻轉、裁切或添加雜訊，創造更多樣的樣本。對於文字資料，可利用同義詞替換或回譯法擴增。若預算允許，利用生成模型產生合成資料也是目前產業界積極採用的方案。

### 為什麼資料清理與前處理在 AI 專案中如此重要？

機器學習領域有一句名言叫垃圾進，垃圾出(Garbage In, Garbage Out)。演算法本質上是資料的放大器，若訓練資料包含大量錯誤標註、極端離群值或系統性偏見，模型不僅無法學習到正確的邏輯，還會將這些錯誤內化並放大。高品質的資料清理能顯著降低模型的認知負擔，提高收斂速度。實務上，改善資料品質帶來的準確率提升，往往比花費數週時間去調整深層神經網路的超參數來得更巨大。

### 什麼是資料不平衡問題，對模型有何影響及如何解決？

資料不平衡是指各類別的樣本數量差異懸殊，例如健康樣本佔百分之九十九，而患病樣本僅佔百分之一。這會導致模型傾向預測多數類別以輕易獲得高準確率，卻完全喪失找出少數關鍵類別的能力。解決方案包括在資料層面進行少數類過採樣(如 SMOTE 演算法)或多數類欠採樣。在演算法層面，可修改損失函數，給予少數類樣本較高權重，或使用焦點損失(Focal Loss)迫使模型專注難以分類的樣本。

---

來源：https://aiterms.tw/terms/data
快查頁：https://aiterms.tw/terms/data
最後更新：2026/06/27
深度解說：https://aiterms.tw/learning/what-is-data