---
title: "樣本自適應梯度估計（SAGE）"
slug: sage
language: zh-TW
source: https://aiterms.tw/terms/sage
updated_at: 2026-06-22
tags: [可解釋 AI, Shapley 值, 特徵重要性, 模型解釋, XAI]
ipas_term: false
---

# 樣本自適應梯度估計（SAGE）

透過對不同訓練樣本動態調整梯度估計策略，在保持訓練穩定的前提下提升收斂效率的機器學習優化技術。

## 完整說明

SAGE（Sample-Adaptive Gradient Estimation，樣本自適應梯度估計）是一類在機器學習訓練優化領域的技術方法，其核心思想是根據每個訓練樣本或小批次（Mini-batch）的特性，動態調整梯度的估計方式或採樣策略，從而在訓練資料利用效率、梯度估計準確性與計算成本之間取得更好的平衡。在 AI 研究文獻中，SAGE 也可能指特徵重要性解釋方法 Shapley Additive Global Explanations 的縮寫，用於全域模型可解釋性分析。

## 常見問題

### SAGE 與 SHAP 有什麼關聯和區別？

SAGE 和 SHAP 都基於合作賽局論中的 Shapley 值框架，但關注的層次不同。SHAP（SHapley Additive Explanations）計算的是每個特徵對某一個具體預測樣本的貢獻，屬於局部解釋（Local Explanation），回答的問題是「對於這個特定的病人，哪些特徵讓模型預測他患有高風險？」SAGE 計算的則是每個特徵對整體模型效能的全域貢獻，屬於全域解釋（Global Explanation），回答的問題是「在所有病人的資料上，哪個特徵對模型整體的預測準確率貢獻最大？」兩者可以互補使用：SAGE 幫助理解哪些特徵對模型最重要，SHAP 幫助理解模型對具體個案的決策邏輯。

### SAGE 在實際應用中計算成本高嗎？如何估計？

SAGE 的精確計算需要枚舉所有特徵的子集組合，計算複雜度隨特徵數量指數增長，對於特徵數超過 20 個的模型，精確計算在實務上不可行。因此，SAGE 的實際應用通常採用蒙地卡羅採樣（Monte Carlo Sampling）進行近似估計：隨機抽取大量的特徵子集，計算加入或移除目標特徵時模型效能的變化，再取平均值作為 SAGE 值的估計。採樣次數越多，估計越精確，但計算時間也越長。SAGE 的開源實作（Python 套件 sage）提供了收斂診斷工具，讓使用者能夠在準確度和計算時間之間進行取捨。通常對於中等規模的模型和資料集，幾千次採樣已能得到穩定的估計。

### SAGE 適合用於哪些類型的 AI 模型？

SAGE 是一種模型無關（Model-Agnostic）的可解釋性方法，理論上可以應用於任何能夠給出預測輸出的 AI 模型，包括黑箱模型（如神經網路、XGBoost、隨機森林）和白箱模型（如線性回歸、決策樹）。唯一的要求是能夠移除或遮蔽某個特徵的資訊（通常透過將該特徵的值替換為從邊際分佈中採樣的值來模擬移除效果）並重新計算模型輸出。SAGE 在具有大量特徵的複雜模型上尤為有用，因為人工理解數十個特徵的相互作用非常困難，而 SAGE 提供了一個量化、可比較的全域重要性排名，幫助決策者識別核心特徵並考慮特徵精簡。

---

來源：https://aiterms.tw/terms/sage
快查頁：https://aiterms.tw/terms/sage
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-sage