---
title: "負載平衡器（Load Balancer）"
slug: load-balancer
language: zh-TW
source: https://aiterms.tw/terms/load-balancer
updated_at: 2026-06-22
tags: [雲端架構, AI 部署, 基礎設施, 可用性, 分散式系統]
ipas_term: false
---

# 負載平衡器（Load Balancer）

將進入的網路請求或運算工作分配到多台伺服器的基礎設施元件，避免單點過載並提升系統可用性。

## 完整說明

負載平衡器（Load Balancer）是一種基礎設施元件，位於用戶端與後端伺服器群之間，依照預設策略（如輪詢、最少連線、IP 雜湊等）將進入的請求分散到多個伺服器實例，達到避免單台過載、提升系統可用性與吞吐量的目的。在 AI 服務部署中，負載平衡器負責將推論請求分配到多個 GPU 伺服器或模型實例，是 AI 產品規模化的關鍵基礎設施。

## 常見問題

### 為 AI 推論服務設計負載平衡器時，和一般 Web 服務有什麼不同？

AI 推論（特別是 LLM 推論）有幾個特殊性需要考量。第一，請求處理時間差異極大，短提示詞和長文件摘要的延遲可能差數十倍，因此應優先考慮「最少連線」或「最短回應時間」等動態策略，而非簡單的輪詢。第二，GPU 記憶體是珍貴資源，過載不只是 CPU 或頻寬問題，還涉及 GPU 記憶體溢出（OOM）導致服務崩潰的風險，健康檢查需要包含 GPU 狀態監控。第三，LLM 的流式輸出（streaming）要求負載平衡器支援長連線（keep-alive）和 Server-Sent Events，不能在回應完成前過早關閉連線。第四，模型冷啟動時間較長，新實例加入輪換前需要較長的暖機等待期。

### 負載平衡和 API Gateway 有什麼區別？

兩者功能有重疊但定位不同，在現代架構中通常共存。API Gateway 是應用層的入口，主要職責包含 API 認證授權、速率限制（Rate Limiting）、請求/回應轉換、API 版本管理、以及監控記錄。負載平衡器的核心職責是流量分發到後端伺服器群，以提高可用性和吞吐量。一般架構是：客戶端 → API Gateway（負責身份驗證、限流）→ 負載平衡器（負責請求分發）→ 多個後端實例。部分雲端服務（如 AWS ALB）同時具備 L7 負載平衡和部分 API Gateway 功能，邊界有時會模糊，但核心用途仍有差異。

### 什麼是健康檢查（Health Check），為什麼對 AI 服務特別重要？

健康檢查是負載平衡器定期向後端伺服器發送探測請求（如 HTTP GET /health），確認伺服器是否正常運作的機制。如果某台伺服器在連續幾次探測中沒有回應或回應異常，負載平衡器會將其標記為不健康並停止分配新請求，待恢復後再重新加入。對 AI 服務特別重要的原因有：第一，模型載入到 GPU 記憶體需要數秒甚至數分鐘，健康檢查可確保只有模型完全就緒的實例才接收請求；第二，GPU OOM（記憶體不足）可能導致推論服務僵死但 HTTP 端口仍開著，深度健康檢查（如測試一個實際的推論請求）比單純的 TCP 連線檢查更能發現此類問題；第三，在自動縮放場景中，健康檢查決定了新實例何時可以接流量，直接影響服務的無縫擴展。

---

來源：https://aiterms.tw/terms/load-balancer
快查頁：https://aiterms.tw/terms/load-balancer
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-load-balancer