越獄 Jailbreak
通過輸入設計或提示工程來繞過 AI 模型的安全限制,使其執行原本被禁止的行為
AI安全AI倫理與治理機器學習
查詢 Transformer、RAG、AI Agent 等 AI 術語,包含定義、iPAS 考點分析、常見問題與 Markdown 版本。
通過輸入設計或提示工程來繞過 AI 模型的安全限制,使其執行原本被禁止的行為
一種對大型語言模型或其他 AI 系統的攻擊方法,通過巧妙地設計輸入提示詞或利用模型的漏洞,繞過系統的安全防護和內容政策限制,使模型生成原本應該被阻止的內容,如有害建議、違法信息或有成見的輸出。
詹森-夏農散度(Jensen-Shannon Divergence, JSD)是一種衡量兩個機率分布相似程度的對稱指標,以 KL 散度為基礎改良,輸出範圍為 [0, 1](使用以 2 為底的對數時),