---
title: "信息抽取（Information Extraction）"
slug: information-extraction
language: zh-TW
source: https://aiterms.tw/terms/information-extraction
updated_at: 2026-06-22
tags: [自然語言處理, AI應用, AI基礎]
ipas_term: false
---

# 信息抽取（Information Extraction）

從非結構化文本中自動識別和提取特定信息的技術，將非結構化數據轉為結構化知識。

## 完整說明

信息抽取（Information Extraction, IE）是自然語言處理的核心任務，旨在從文本中自動識別和提取目標信息，如人名、組織名、地點、事件、關鍵數值等。與文本分類或摘要不同，IE 著重提取具體、結構化的信息片段。現代 IE 系統使用序列標註、命名實體識別、事件抽取等技術，應用於新聞分析、知識圖譜構建、商業智能等領域。

## 常見問題

### 信息抽取與關鍵詞搜尋有什麼區別？

關鍵詞搜尋是簡單的模式匹配，尋找特定字符串出現；信息抽取則是智能理解，提取隱含的語義信息。例如，搜尋「CEO」關鍵詞可能找到「he is the CEO」和「CEO of company」，但無法理解誰是 CEO。而 IE 系統能理解句子結構，正確識別「John 是 Microsoft 的 CEO」中，「John」是「CEO」實體，「Microsoft」是「組織」實體。此外，IE 能處理同義表述，如「John 領導 Microsoft」也會被識別為同樣的關係。

### 如何提高信息抽取的精度？

提高精度的策略包括：1) 使用預訓練語言模型（如 BERT）作為基礎，微調適應特定領域；2) 增加訓練數據量和品質，使用主動學習策略優先標註困難樣本；3) 設計良好的特徵，結合詞性標註、句法樹、外部知識庫；4) 採用多任務學習，同時訓練相關任務（如 NER 和關係抽取）；5) 引入領域知識，如行業術語表、知識圖譜；6) 集成多個模型進行投票；7) 在測試時使用上下文窗口和反覆檢查以減少誤差。實踐中，結合多種策略往往效果最佳。

### 信息抽取系統如何處理領域轉移？

領域轉移（Domain Shift）是 IE 系統的常見問題。在醫療領域訓練的 NER 模型在金融新聞上效果不佳，因為術語和表達方式差異。應對策略包括：1) 領域適應技術，如無監督領域適應、自訓練；2) 遷移學習，使用通用預訓練模型減少領域差異；3) 少樣本或零樣本學習，用最少數據適應新領域；4) 數據增強，合成新領域的訓練樣本；5) 領域共享特徵學習，識別跨領域的通用模式；6) 融合多源領域知識。實際應用中，採用多領域預訓練（在多個領域上訓練一個通用模型）後微調往往效果最優。

---

來源：https://aiterms.tw/terms/information-extraction
快查頁：https://aiterms.tw/terms/information-extraction
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-information-extraction