AI 幻覺是大型語言模型產生自信但事實錯誤或無中生有內容的現象,是 LLM 部署的主要風險
容易混淆
幻覺 vs 錯誤資訊 幻覺是模型自己編出不存在的內容 錯誤資訊可能是人或系統傳錯 最關鍵的區別是無中生有,還是傳播失真
幻覺 vs 偏見 偏見是輸出方向系統性歪掉 幻覺是內容本身可能根本不存在 最關鍵的區別是有但歪,還是根本編造
記住這句就好
說得很像真的,不代表是真的。
實際案例
虛構引用 法律文件或論文摘要裡,如果 AI 生成不存在的案例或論文名稱,這就是典型幻覺。
產品規格亂答 客服模型把不存在的規格講得很肯定,表面上很順,實際上就是幻覺在作怪。
深入了解
大型語言模型的目標是預測下一個詞,不是自動查證事實。 RAG、查核工具、低溫度和人工審核都能降低風險,但很難把幻覺完全消掉。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| AI 幻覺 | 台灣媒體與技術文章最常見的說法 |
| 幻覺、模型幻覺 | 簡稱 |
| AI 幻觉 | 簡體寫法 |
| Hallucination | 英文原名,論文與技術文件用這個字 |
| Confabulation(虛談) | 部分研究者偏好的替代詞,認為比幻覺更精確 |
| 一本正經地胡說八道 | 中文網路上的口語形容 |
有研究者反對「幻覺」這個譯法,理由是幻覺在醫學上指的是感知到不存在的事物,而語言模型並沒有感知,它是在生成統計上合理但事實上錯誤的內容。Confabulation 在神經科學裡指「不自覺地編造記憶來填補空白」,跟模型的行為更接近。不過幻覺已經是通行用語。
分成兩類,處理方式不同
| 類型 | 定義 | 例子 |
|---|---|---|
| 事實性幻覺 | 說出跟真實世界不符的內容 | 編造不存在的論文、把兩個人的經歷搞混 |
| 忠實性幻覺 | 說出跟提供的來源不符的內容 | 摘要時加入原文沒有的資訊 |
忠實性幻覺比較好處理,因為有明確的比對基準(給定的文件)。事實性幻覺難得多,因為需要一個外部的真實世界知識來源。
為什麼會發生
訓練目標本來就不是說實話。 語言模型學的是「下一個詞出現的機率」,流暢與正確是兩件事。一個流暢但錯誤的句子,在訓練目標上不一定比不流暢但正確的句子差。
訓練資料本身有錯、有矛盾、有過時資訊。
模型沒有「我不知道」的自然出口。 除非特別訓練過,模型面對不確定的問題傾向給出一個答案而不是承認不知道。RLHF 有時反而加重這件事,因為人類標註者常常偏好看起來有自信的回答。
越冷門的問題越容易編。 訓練資料裡出現次數少的實體,模型只有模糊的統計印象,容易把相近的東西混在一起。
實務上怎麼壓低
檢索增強生成(RAG):先檢索出可靠文件,要求模型只根據文件回答並附上出處。這是目前最有效的單一手段。
要求引用並驗證引用:讓模型標出每一句話的來源段落,再用程式檢查那段話是否真的存在於來源。
降低隨機性:需要事實正確的任務把 temperature 調低。
自我一致性檢查:同一個問題問多次,答案不一致的部分就是高風險區。
交給人審核高風險輸出:醫療、法律、財務等領域,目前沒有任何技術手段可以取代這一步。
要注意的是,這些手段都是降低發生率,沒有任何方法能保證完全消除。任何宣稱「零幻覺」的說法都要看它是怎麼定義與量測的。
情境判斷
Q1: AI 給你的論文引用,你要不要直接照抄? → 不要,先查證來源是否真的存在。
Q2: 同樣是回答錯誤,為什麼幻覺特別麻煩? → 因為它常常語氣很肯定,讓人更容易信以為真。
AI 幻覺 在 iPAS 考試中的重點
根據歷年統計,AI 幻覺 相關題目 平均佔 AI 技術類考題 2%, 屬於未分類考範圍。
常見出題方向:大型語言模型的行為與限制(40%)、模型評估與錯誤分析方法(35%)、AI 幻覺的成因與緩解策略(25%)。
閱讀這頁時的常見誤區
只背中英文對照,無法判斷術語的適用情境。先確認定義,再對照完整說明與相關概念,頁面中的考試比重或出題方向,必須和下方標示的資料來源一起閱讀。
相關術語
常見問題
幻覺能完全消除嗎?
目前很難,只能盡量降低發生率。
模型為什麼不直接說不知道?
因為它被訓練成盡量給出有幫助的回應,不是自然學會拒答。
最新模型就不會幻覺嗎?
不會,新模型通常更穩,但仍需要查證。
資料來源
- AITerms.tw 術語資料庫,最後更新:2026-07-29。
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定