---
title: "Sigmoid 函數（Sigmoid）"
slug: sigmoid
language: zh-TW
source: https://aiterms.tw/terms/sigmoid
updated_at: 2026-06-22
tags: [神經網路, 深度學習, 機器學習, 統計方法]
ipas_term: false
---

# Sigmoid 函數（Sigmoid）

Sigmoid 函數是一種將任意實數壓縮到 (0, 1) 區間的 S 形曲線，公式為 σ(x) = 1/(1+e⁻ˣ)，常作為神經網路的激活函數及邏輯斯迴歸的輸出層，用於將線性輸出轉換為機率值。

## 完整說明

Sigmoid 函數（全稱 Logistic Sigmoid Function）將輸入映射到 (0, 1) 的開區間，輸出可直接解讀為二元事件的機率。在邏輯斯迴歸中，Sigmoid 是模型的核心元件。在深度神經網路的早期，Sigmoid 曾是隱藏層的主流激活函數，但因梯度消失問題（輸入絕對值越大，梯度趨近於零），現已被 ReLU 及其變體取代為隱藏層的主要選擇，然而在二元分類的輸出層與門控機制（如 LSTM 的閘）中仍廣泛使用。

## 常見問題

### 為什麼 Sigmoid 在深度神經網路的隱藏層中被 ReLU 取代？

核心原因是梯度消失問題。Sigmoid 的導數 σ'(x) = σ(x)(1−σ(x)) 在 x 的絕對值增大時趨近於零：當 |x| = 5 時，導數僅約 0.007。在多層反向傳播中，各層的梯度相乘，使最終梯度以指數速度縮小，導致淺層幾乎無法學習。ReLU 在正半軸的導數恆為 1，不存在梯度衰減問題。此外，Sigmoid 輸出始終為正（非零中心），導致梯度同號，更新方向受限，而 ReLU 不具此缺陷。

### Sigmoid 在邏輯斯迴歸與神經網路輸出層的用法有何不同？

邏輯斯迴歸中，Sigmoid 是整個模型的唯一非線性元件，將線性組合轉換為二元機率，模型訓練等同於最大似然估計（MLE）。在神經網路的輸出層，Sigmoid 是多層非線性轉換後的最後一步，前面各層已由 ReLU 等激活函數建立複雜的特徵表示，Sigmoid 只負責將最終線性輸出壓縮至機率區間。兩者的 Sigmoid 功能相同，但前者的 Sigmoid 承擔所有表示學習，後者只做最後的輸出轉換。

### Sigmoid 和 Softmax 在多類別問題中如何選擇？

關鍵在於類別是否互斥。若每個樣本只屬於一個類別（單標籤多分類，如手寫數字辨識 0-9），使用 Softmax：它強制所有類別機率總和為 1，使模型在各類別間做出明確選擇。若每個樣本可同時屬於多個類別（多標籤分類，如影像同時包含「貓」和「戶外場景」），使用 Sigmoid：每個類別獨立輸出機率，彼此之間不相互競爭。混用兩者（例如互斥問題用 Sigmoid）會破壞機率解釋的正確性。

---

來源：https://aiterms.tw/terms/sigmoid
快查頁：https://aiterms.tw/terms/sigmoid
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-sigmoid