---
title: "越獄（Jailbreak）"
slug: jailbreak
language: zh-TW
source: https://aiterms.tw/terms/jailbreak
updated_at: 2026-06-23
tags: [AI安全, AI倫理與治理, 機器學習]
ipas_term: false
---

# 越獄（Jailbreak）

通過輸入設計或提示工程來繞過 AI 模型的安全限制，使其執行原本被禁止的行為

## 完整說明

越獄是指使用特定的提示、指令或技巧來繞過 AI 系統（特別是大型語言模型）的安全防護和使用政策限制。成功的越獄可以導致 AI 模型生成有害內容、提供非法建議、或以其他方式違反其設計的道德準則和安全政策。

## 常見問題

### 為什麼很難完全防止越獄攻擊？

防止越獄的困難在於安全、功能和易用性之間的根本權衡。完全防止越獄可能需要如此多的限制，以至於模型變得無用。另一個挑戰是語言的創意性和靈活性。自然語言中存在無限多種表達同一概念的方式，這使得通過簡單的關鍵詞過濾來完全阻止所有有害內容變得不可能。此外，隨著新的越獄技術被發現，防禦也需要進化。最後，不同用戶對什麼是「有害」有不同的定義，這意味著一個嚴格針對所有用戶的防禦策略可能會過度阻止某些合法使用。

### 越獄與 AI 模型的訓練過程有什麼關係？

越獄的有效性與模型的訓練方式密切相關。模型是通過在大量文本數據上進行訓練而學到的行為，其中包括如何遵循指令和避免有害內容。然而，這種訓練不是完美的。如果訓練數據不足或不夠多樣化，模型可能在某些情況下缺乏強有力的防禦。此外，訓練過程通常涉及微調階段，其中模型通過人類反饋進行進一步調整以遵守安全準則。但這種微調可能不完全有效或可能留下漏洞。隨著模型變得更加複雜和能力更強，找到能夠有效防止所有可能的有害行為的訓練方法變得更具挑戰性。

### 組織應如何應對越獄的威脅？

組織應實施多層次的防禦策略來應對越獄。首先，使用經過安全訓練的模型，並保持它們更新到最新版本。其次，實施使用政策和監督，監控模型的使用方式，並標記可疑或有害的請求。第三，結合人工審查，特別是對於關鍵或敏感的應用。第四，進行定期的安全審計和紅隊測試，以發現潛在的越獄漏洞。第五，教育用戶關於負責任的 AI 使用和潛在風險。第六，與 AI 供應商合作，報告發現的漏洞，並使用他們提供的安全更新。最後，認識到沒有完美的防禦，並有計劃應對越獄的成功嘗試。

---

來源：https://aiterms.tw/terms/jailbreak
快查頁：https://aiterms.tw/terms/jailbreak
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-jailbreak