---
title: "詞頻-逆文檔頻率（TF-IDF）"
slug: tf-idf
language: zh-TW
source: https://aiterms.tw/terms/tf-idf
updated_at: 2026-06-23
tags: [自然語言處理, 信息檢索, 特徵提取, 文本挖掘]
ipas_term: false
---

# 詞頻-逆文檔頻率（TF-IDF）

TF-IDF 是信息檢索和文本挖掘中的經典特徵提取方法。它通過計算詞的局部重要性（TF）和全局重要性（IDF）的乘積，評估詞在文檔中的相關性。

## 完整說明

TF-IDF（Term Frequency-Inverse Document Frequency，詞頻-逆文檔頻率）是信息檢索和自然語言處理領域中最經典和廣泛使用的文本特徵提取方法。它基於一個直觀的假設：一個詞對文檔的重要性與它在該文檔中出現的頻率成正比，但與它在整個文檔集合中出現的頻率成反比。TF-IDF 算法簡潔高效，易於理解和實現，是許多文本分類、信息檢索和推薦系統的基礎。

## 常見問題

### 為什麼 TF-IDF 中要除以文檔長度？

除以文檔長度是為了進行長度歸一化。如果不進行歸一化，長文檔會因為包含更多的詞而自然獲得更高的 TF 值，即使這些詞對確定文檔主題沒有特殊意義。歸一化確保了詞頻的公平比較，使得短文檔和長文檔的詞頻值具有可比性。

### TF-IDF 在處理語言多樣性時有什麼限制？

TF-IDF 基於詞袋模型，完全忽略了詞的順序和句子結構，也無法理解詞之間的語義關係。例如，同義詞會被視為完全不同的詞。此外，它還難以處理多語言文本、符號和特殊術語等。現代的方法如詞嵌入（Word2Vec、GloVe）和語言模型（BERT）能更好地捕捉語義信息。

### TF-IDF 與現代深度學習方法相比如何？

深度學習方法（如 BERT、GPT）能夠捕捉更複雜的語義和句法信息，通常在各種 NLP 任務上表現更優。然而，TF-IDF 仍有優勢：它計算簡單、無需大規模訓練數據、可解釋性強、計算速度快。在資源有限或需要快速實現的場景中，TF-IDF 仍然是一個可靠的選擇。許多現代系統會結合兩者，使用 TF-IDF 作為初步篩選或基線方法。

---

來源：https://aiterms.tw/terms/tf-idf
快查頁：https://aiterms.tw/terms/tf-idf
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-tf-idf