---
title: "資訊檢索（Retrieval）"
slug: retrieval
language: zh-TW
source: https://aiterms.tw/terms/retrieval
updated_at: 2026-06-27
tags: [自然語言處理, 生成式AI, 大型語言模型, AI基礎, source:arxiv]
ipas_term: false
---

# 資訊檢索（Retrieval）

從大規模資料庫中快速且精準地找出與使用者查詢高度相關的資訊或文件的核心技術。

## 完整說明

資訊檢索是一種從龐大非結構化或結構化資料庫中尋找目標資訊的技術，用於幫助系統理解查詢意圖並返回最相關的結果，常見應用包括搜尋引擎、問答系統以及檢索增強生成（RAG）架構中的知識庫查詢。

## 常見問題

### 檢索技術在 RAG 架構中扮演什麼樣的角色？

在 RAG（檢索增強生成）架構中，檢索扮演著「知識提供者」與「事實守門員」的關鍵角色。當使用者提問時，檢索系統會優先從企業內部或可信賴的外部知識庫中，快速尋找出最相關的文件片段。這些片段隨後會連同使用者的問題一起餵給語言模型，確保模型在生成回答時，有堅實的事實基礎可以參考，大幅降低了模型憑空捏造（幻覺）的風險，同時解決了語言模型無法即時更新知識的問題。

### 向量檢索 (Dense Retrieval) 真的可以完全取代傳統的關鍵字檢索嗎？

並不能完全取代。雖然向量檢索強大於理解語意與上下文，即使關鍵字不完全匹配也能找到相關內容，但在特定情境下它表現不佳。例如當使用者想要精確搜尋特定的產品序號、罕見人名或專有代碼時，傳統的關鍵字檢索（如 TF-IDF 或 BM25）反而能提供更精準的絕對匹配。因此，目前業界最推薦的做法是採用「混合檢索 (Hybrid Retrieval)」，結合兩者的優勢，再透過重排模型來提升最終結果的品質。

### 為什麼檢索出來的資料品質會直接影響 AI 的表現？

這是因為語言模型在 RAG 流程中極度依賴提示詞（Prompt）提供的上下文。業界常說的「垃圾進，垃圾出 (Garbage In, Garbage Out)」在這裡完全適用。如果檢索系統因為演算法不佳或索引混亂，找出了錯誤、過時或不相關的文件，語言模型就會基於這些錯誤資訊進行推理與總結，最終產生的回答必然也是錯誤的。因此，優化文件的切塊 (Chunking) 策略與檢索準確率，往往比單純更換更大的語言模型更能提升系統的整體表現。

---

來源：https://aiterms.tw/terms/retrieval
快查頁：https://aiterms.tw/terms/retrieval
最後更新：2026/06/27
深度解說：https://aiterms.tw/learning/what-is-retrieval