---
title: "共現矩陣（Co-occurrence Matrix）"
slug: co-occurrence-matrix
language: zh-TW
source: https://aiterms.tw/terms/co-occurrence-matrix
updated_at: 2026-07-30
tags: [自然語言處理, 統計方法, 矩陣分解, 詞向量, 特徵表示]
ipas_term: false
---

# 共現矩陣（Co-occurrence Matrix）

統計語料中詞對同時出現的頻次形成的矩陣，是許多詞向量和 NLP 方法的基礎。

## 完整說明

共現矩陣（Co-occurrence Matrix）是自然語言處理中的一個基礎統計工具，記錄詞對在特定上下文窗口內同時出現的頻次。矩陣形式為 |V| × |V|（|V| 為詞表大小），矩陣元素 X_ij 表示詞 i 和詞 j 的共現次數。共現矩陣蘊含詞的語義關係，是 LSA、GloVe 等方法的基礎。

## 常見問題

### 共現矩陣會不會過於龐大，難以儲存和計算？

確實會。詞表 100 萬詞時，共現矩陣理論上有 1 兆個元素，若每個元素用 4 字節整數，需 4 TB 記憶體：完全不可行。但實務上：第一，只需儲存非零元素。真實語料中絕大多數詞對共現頻次為 0；常用的稀疏矩陣格式（CSR、COO）只儲存非零元素，通常將矩陣壓縮到原大小的 0.01% 以下。第二，可用「二次採樣」：訓練時隨機跳過低頻詞對，只統計高頻共現，進一步降低計算量。第三，若不需要完整矩陣，可採用流式更新：掃描一次語料邊統計邊計算，無需同時載入整個矩陣。

### 共現矩陣和詞-文件矩陣有什麼區別？

共現矩陣統計的是詞與詞在局部上下文窗口內同時出現的頻次，矩陣大小 |V| × |V|。詞-文件矩陣統計的是詞在整個文件中的出現次數，矩陣大小 |V| × |D|（|D| 為文件數，通常遠小於 |V|²）。兩者反映的語義結構不同：詞-詞共現捕捉的是詞的局部句法與語義關係；詞-文件共現捕捉的是詞的主題親和性。在應用上，詞-詞共現用於詞的表示與相似度計算，詞-文件共現用於文本分類、主題建模、文件相似度。兩者在 LSA 中可統一為矩陣分解框架。

### 共現矩陣已被詞向量取代，還需要理解它嗎？

非常值得。理解共現矩陣是理解詞向量和整個統計 NLP 的基礎。許多詞向量方法（Word2Vec、GloVe、FastText）其實都在某種意義上利用或分解共現統計；Transformer 和 BERT 等現代模型雖然用神經網路參數化，其核心仍是對上下文統計的學習。掌握共現矩陣能深入理解為什麼詞向量能捕捉語義、為什麼相似詞的向量相近。此外，在資源受限場景（如邊緣裝置、低資源語言）或需要可解釋性的應用，共現矩陣 + 統計方法仍是務實選擇。最後，許多業界系統的第一版本常用簡單的共現統計做基準線，值得掌握。

---

來源：https://aiterms.tw/terms/co-occurrence-matrix
快查頁：https://aiterms.tw/terms/co-occurrence-matrix
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-co-occurrence-matrix