---
title: "全局向量表示法（GloVe）"
slug: glove
language: zh-TW
source: https://aiterms.tw/terms/glove
updated_at: 2026-07-30
tags: [自然語言處理, 詞向量, 矩陣分解, 統計方法, 預訓練]
ipas_term: false
---

# 全局向量表示法（GloVe）

透過全局詞共現統計學習詞向量，將詞對共現頻次分解為兩個向量的內積。

## 完整說明

GloVe（Global Vectors for Word Representation）是由 Stanford 大學研究團隊於 2014 年提出的詞向量學習方法。它結合矩陣分解與局部窗口方法的優點，先構建全局詞共現矩陣，再優化目標函數使詞向量的內積接近共現統計。相比 Word2Vec 的局部上下文窗口方法，GloVe 更系統地利用了全局統計資訊。

## 常見問題

### 為什麼 GloVe 要使用權重函數 f(x)？不能直接平方誤差嗎？

直接優化 (w_i^T c_j - log(X_ij))^2 會導致一個嚴重問題：常用詞對（如「the」與「a」）的共現頻次極高（可能達數百萬次），會完全主導損失函數，使模型集中力量擬合這些高頻對，而忽視低頻但具有語義信息的詞對。例如，「机器學習」這個詞對共現頻次遠低於「the a」，卻蘊含更多語義資訊。GloVe 的權重函數解決了這個問題：給予高頻共現適度權重（上限 1），給予低頻共現相對較高的權重，使模型對所有共現關係更加「民主化」地對待。這是統計學習中的常見技巧，類似於 NLP 中的詞頻逆文件頻率（TF-IDF）思想。

### GloVe 的共現矩陣會不會非常大？怎麼處理？

確實會。若詞表有 100 萬個詞，共現矩陣理論上是 100 萬 × 100 萬 = 1 兆個元素。但實務上大多數詞對共現頻次為零（稀疏矩陣），只需儲存非零元素。GloVe 的實作通常採用「二次採樣」策略：遍歷語料時，以概率 p_ij 採樣詞對 (i, j)，跳過共現頻次極低的詞對。此外，只儲存非零元素的稀疏矩陣格式（如 COO 或 CSR）可大幅節省空間。Google 發表的一篇論文指出，對於十億級別詞彙語料，用稀疏矩陣表示共現矩陣通常可行且高效。

### 是否應該用 GloVe 代替 Word2Vec？

選擇應基於具體需求。若專注於詞類比和語義評估任務，GloVe 通常稍優；若需要快速訓練大規模詞向量，Skip-gram（Word2Vec）的高效性更吸引人。在實務應用中，預訓練的詞向量質量往往比算法選擇更重要：使用高質量的公開 GloVe 或 Word2Vec 向量通常比自己訓練更高效。若預算允許，現代做法是採用 BERT、GPT 等語境化向量，它們在大多數任務上超越兩者。

---

來源：https://aiterms.tw/terms/glove
快查頁：https://aiterms.tw/terms/glove
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-glove