---
title: "詹森-夏農散度（Jensen-Shannon Divergence）"
slug: jensen-shannon-divergence
language: zh-TW
source: https://aiterms.tw/terms/jensen-shannon-divergence
updated_at: 2026-06-22
tags: [統計方法, 模型評估, 機器學習, 生成式AI]
ipas_term: false
---

# 詹森-夏農散度（Jensen-Shannon Divergence）

詹森-夏農散度（Jensen-Shannon Divergence, JSD）是一種衡量兩個機率分布相似程度的對稱指標，以 KL 散度為基礎改良，輸出範圍為 [0, 1]（使用以 2 為底的對數時），

## 完整說明

詹森-夏農散度（Jensen-Shannon Divergence, JSD）定義為兩個機率分布 P 和 Q 對其均值分布 M = (P+Q)/2 的 KL 散度平均值：JSD(P‖Q) = (KL(P‖M) + KL(Q‖M)) / 2。相較於 KL 散度，JSD 具有對稱性（JSD(P‖Q) = JSD(Q‖P)）且值域有界（0 至 log 2），不會因 P 或 Q 中存在零機率事件而發散。常用於衡量語言模型輸出分布與參考分布的差異、偵測資料漂移，以及評估 GAN 訓練品質。

## 常見問題

### JSD 和 KL 散度最重要的差異是什麼？

兩者最關鍵的差異有三點。第一，對稱性：KL 散度具有方向性（KL(P‖Q) ≠ KL(Q‖P)），JSD 是對稱的（JSD(P‖Q) = JSD(Q‖P)），因此 JSD 更適合「中立地比較兩個分布的差異」。第二，有界性：KL 散度值域為 [0, ∞)，兩分布支撐集不重疊時趨向無窮大；JSD 值域為 [0, 1]，任何情況下都有界，數值更穩定。第三，可解釋性：JSD = 0 代表兩分布完全相同，JSD = 1 代表兩分布完全不重疊，具有直觀的比例意義；KL 散度的數值本身沒有上限，難以跨場景比較。

### 為何原始 GAN 改用 Wasserstein 距離而非繼續用 JSD？

原始 GAN 訓練等價於最小化 JSD，但存在訓練初期兩分布幾乎不重疊的問題：此時 JSD 達到最大值 1，且梯度接近零，生成器無法從判別器獲得有效的學習信號（梯度消失）。Wasserstein 距離（地球搬運距離）的優勢在於即使兩分布完全不重疊，其值仍為有限且連續可微，始終能為生成器提供方向梯度。WGAN 改用 Wasserstein 距離後，訓練穩定性顯著提升，模式崩潰問題也大幅緩解。JSD 的貢獻在於讓研究者從理論上理解了 GAN 的訓練機制和失敗原因。

### iPAS 考題中 JSD 的考試重點是什麼？

iPAS 中級考題中 JSD 常以三種形式出現：一是概念辨識題，比較 KL 散度、JSD、Wasserstein 距離的對稱性和值域，考生需記住 JSD 是對稱且有界（0 到 1）的；二是應用場景題，詢問「偵測資料分布漂移用哪種指標較合適」，JSD 有界且對稱是其優於 KL 散度的理由；三是 GAN 分析題，解釋原始 GAN 訓練困難的原因（兩分布不重疊時 JSD 梯度消失），以及 WGAN 的改進方向。考生應能說明 JSD 的定義公式（透過中間分布 M 的 KL 散度平均）及其核心性質。

---

來源：https://aiterms.tw/terms/jensen-shannon-divergence
快查頁：https://aiterms.tw/terms/jensen-shannon-divergence
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-jensen-shannon-divergence