---
title: "稠密文段檢索（Dense Passage Retrieval）"
slug: dense-passage-retrieval
language: zh-TW
source: https://aiterms.tw/terms/dense-passage-retrieval
updated_at: 2026-06-23
tags: [檢索增強, 自然語言處理, 機器學習, 神經網路]
ipas_term: false
---

# 稠密文段檢索（Dense Passage Retrieval）

使用深度學習模型進行端到端訓練的文段檢索方法，將查詢和文段都編碼為密集向量，通過向量相似度進行匹配。

## 完整說明

稠密文段檢索（DPR）是一種神經網路架構，它使用兩個獨立的編碼器分別將查詢和文段編碼為高維密集向量。與傳統基於稀疏詞彙匹配的檢索方法不同，DPR 捕捉了文本的語義信息，允許語義相似但詞彙差異較大的查詢和文段進行匹配。通過雙編碼器架構和對比學習訓練，DPR 在多個開放域問答任務上實現了顯著的性能提升。

## 常見問題

### 為什麼 DPR 需要複雜的負例採樣策略？

負例在對比學習中起著至關重要的作用。簡單的隨機負例難以有效地訓練模型，因為模型很容易將任何不相等的對區分開來。困難負例（hard negatives）是指 BM25 或其他檢索方法排名較高但實際上不是正確答案的文段，這些負例對於訓練區分微妙語義差異特別有效。採用精心設計的負例採樣策略可以顯著提升模型的判別能力，從而在真實檢索場景中取得更好的性能。

### DPR 編碼向量的維度如何選擇？

向量維度是效能和效率之間的權衡。較低的維度（如 128 維）計算快速但表達能力有限；較高的維度（如 2048 維）表達能力強但計算和存儲成本高。在實踐中，768 到 1024 維度是常見的選擇，在大多數任務上提供了很好的平衡。具體選擇應該根據知識庫大小、預期延遲、可用的硬體資源以及任務複雜度進行調整。

### DPR 可以應用於非英文語言嗎？

可以，但需要針對目標語言進行調整。首先需要目標語言的預訓練語言模型（如多語言 BERT）和目標語言的訓練資料對。許多開放域問答資料集已被翻譯成多種語言，可以直接利用。此外，多語言預訓練模型已經在多語言語料庫上訓練過，對跨語言遷移有一定的幫助。在實踐中，對於低資源語言，可以考慮使用預訓練的多語言模型直接應用，或使用少量資料進行微調。

---

來源：https://aiterms.tw/terms/dense-passage-retrieval
快查頁：https://aiterms.tw/terms/dense-passage-retrieval
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-dense-passage-retrieval