---
title: "越獄攻擊（Jailbreaking）"
slug: jailbreaking
language: zh-TW
source: https://aiterms.tw/terms/jailbreaking
updated_at: 2026-06-22
tags: [AI倫理與治理, 大型語言模型, Prompt工程, AI基礎]
ipas_term: false
---

# 越獄攻擊（Jailbreaking）

一種對大型語言模型或其他 AI 系統的攻擊方法，通過巧妙地設計輸入提示詞或利用模型的漏洞，繞過系統的安全防護和內容政策限制，使模型生成原本應該被阻止的內容，如有害建議、違法信息或有成見的輸出。

## 完整說明

越獄攻擊是指對 AI 系統的安全防護進行的對抗性攻擊，攻擊者設計特殊的提示或輸入，誘導模型忽視其安全指引和對齊訓練，生成有害、非法或違反政策的內容。這些攻擊利用了模型行為與其設計意圖之間的差距。

## 常見問題

### 為什麼越獄如此有效？

越獄有效的原因涉及 LLM 的基本特性和訓練方式。首先，語言的靈活性使得相同的想法可以用無數種方式表達。安全過濾器無法覆蓋所有變體。其次，模型被訓練於遵循指令，這個特性被越獄所利用，攻擊者設計指令使模型遵從而忽視安全準則。第三，LLM 訓練中使用的監督學習和強化學習都涉及某種形式的人類反饋，這必然有差異和不一致。攻擊者利用這些縫隙。第四，模型的泛化能力被利用來推斷可能的有害輸出，即使這些輸出在訓練中未見過。第五，角色扮演和虛擬情景的提示利用了模型執行任何描述情景的傾向，即使那個情景包含違反政策的行為。這些因素結合使得越獄難以完全防止。

### 廠商如何防禦越獄？

防禦越獄的策略是多層面的。首先，改進安全訓練，使用更廣泛的對抗性示例和場景進行訓練。其次，實施輸入/輸出過濾，檢測和阻止已知的有害內容特徵或越獄模式，但這有繞過風險。第三，增加系統提示的魯棒性，使系統指引更難被用戶提示覆蓋。第四，使用解釋性技術理解模型的決策過程，識別脆弱點。第五，進行持續的紅隊測試和越獄搜索，主動發現和修補漏洞。第六，使用人工反饋和強化學習從越獄案例中學習，改進模型的拒絕能力。第七，透明溝通，告知用戶模型的限制和已知的越獄方法，以及如何負責任地報告新發現的漏洞。第八，實施監控和日誌記錄，追蹤模型的異常行為，檢測潛在的越獄活動。防禦不是一次性工作，而是持續的過程。

### 越獄研究有合法的用途嗎？

是的。越獄研究在安全改進中起著關鍵角色。安全研究者透過越獄來發現模型的弱點，然後與廠商協作修復這些弱點。例如，OpenAI 的公開紅隊計畫鼓勵研究者和使用者報告越獄方法以改進 Claude 的安全性。越獄研究幫助我們理解 LLM 對齐的局限，推動更好的訓練方法和安全技術的發展。此外，越獄研究揭示了模型行為中的一致性和脆弱性，有助於開發更健壯的系統。然而，越獄研究也帶來倫理責任。研究者應該負責任地披露發現，給廠商足夠時間修複，而不是公開教程允許大規模濫用。許多組織已建立負責任披露政策，鼓勵安全研究同時保護用戶。越獄研究和廠商的安全工作之間的合作對建設更安全、更可信的 AI 系統至關重要。

---

來源：https://aiterms.tw/terms/jailbreaking
快查頁：https://aiterms.tw/terms/jailbreaking
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-jailbreaking