---
title: "自動擴展（Auto Scaling）"
slug: auto-scaling
language: zh-TW
source: https://aiterms.tw/terms/auto-scaling
updated_at: 2026-07-29
tags: [模型部署, AI應用, 機器學習, 深度學習, 最佳化, MLOps, AI基礎]
ipas_term: false
---

# 自動擴展（Auto Scaling）

> **網站在促銷時流量突然暴增，平常的伺服器數量撐得住嗎？**
> 你可以把自動擴展想成會看負載調機器數量的系統，忙的時候加人手，閒的時候收回來。
> 它能讓服務在尖峰時不掛掉，在低峰時不浪費資源。
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆

> **自動擴展 vs 負載平衡？**
> 自動擴展：依負載自動增減資源
> 負載平衡：把現有流量分散到多台機器
> 最關鍵的區別：擴展是增減容量，平衡是分配現有流量
>
> **水平擴展 vs 垂直擴展？**
> 水平擴展：增加機器數量
> 垂直擴展：升級單台機器規格
> 最關鍵的區別：自動擴展通常以水平擴展最常見
>
> **自動擴展 vs 快取？**
> 自動擴展：根據指標自動動作
> 快取：把熱門資料先存起來
> 最關鍵的區別：快取降低壓力，擴展增加容量，作用不同
### 記住這句就好

> 流量上來加資源，流量下來省成本
### 實際案例

> **購物節尖峰**
> 晚間下單暴增時，平台把 Pod 數量拉高，等活動結束後再縮回來
>
> **夜間批次**
> 凌晨工作量低，系統自動縮小資源，白天再依需求補回來
### 算法與應用

> | 重點 | 你要看什麼 | 為什麼重要 |
> |---|---|---|
> | 指標 | CPU、記憶體、請求數 | 用來判斷現在是不是太忙 |
> | 策略 | 閾值、排程、預測 | 決定何時擴展與縮減 |
> | 風險 | 抖動與冷啟動 | 避免一直加減造成不穩定 |

### 三種擴展策略

| 策略 | 觸發依據 | 適合 |
| --- | --- | --- |
| 反應式（reactive） | 目前的指標超過門檻就擴 | 流量變化平緩、可容忍幾分鐘延遲 |
| 排程式（scheduled） | 依時間表，例如每天九點擴 | 尖峰時間可預測，例如上班打卡、每週報表 |
| 預測式（predictive） | 用歷史資料預測未來需求提前擴 | 尖峰陡峭、開機時間長的服務 |

> 三種常常一起用：用排程式處理已知的每日尖峰，反應式當作兜底，預測式再往前補一段暖機時間。

### 挑指標與設參數，這是實務上最容易出錯的地方

> **挑錯指標是最常見的問題。** CPU 使用率是預設選項，但很多服務的瓶頸不在 CPU。佇列長度、每秒請求數、回應時間 P95、GPU 記憶體用量，往往比 CPU 更能反映真實壓力。AI 推論服務尤其明顯，等待中的請求數通常是最直接的訊號。
>
> **冷卻時間（cooldown）沒設好會震盪。** 擴出來的機器需要時間開機、載入模型、通過健康檢查，這段期間指標還是高的。如果沒有冷卻時間，系統會以為擴得不夠而繼續擴，等到全部就緒又發現過剩開始縮，縮完壓力又上來，來回震盪叫做 thrashing。
>
> **縮的門檻要比擴的門檻低很多。** 兩個門檻靠太近同樣會震盪。常見做法是擴的門檻 70%、縮的門檻 30%，中間留一大段死區。
>
> **一定要設下限與上限。** 下限保證半夜沒流量時仍有機器接住突發請求；上限保證程式出錯造成的假性負載不會把帳單燒穿。這一條在 AI 服務上特別重要，GPU 執行個體的單價高一個量級。
>
> **AI 推論的特殊考量：模型載入時間。** 一般 Web 服務新機器幾秒就能服務，載入一個大模型可能要數分鐘。這代表反應式擴展幾乎一定來不及，必須靠預測式或保留一批熱備份。

### 情境判斷

> **Q1：如果 CPU 長時間超過門檻，自動擴展該不該啟動？**
> → 通常該啟動，因為這代表目前容量可能不夠
>
> **Q2：流量忽高忽低時，一直擴展和縮減都很頻繁，這代表什麼？**
> → 代表門檻或冷卻時間可能設太敏感，需要調整策略避免抖動
### 常見問題

> **Q：自動擴展和自動伸縮是一樣嗎？**
> 大致上是同一類概念，實務上常拿來指依負載自動調整資源。
>
> **Q：擴展一定要搭配雲端嗎？**
> 不是，但雲端平台通常最方便做自動化擴縮。
>
> **Q：自動擴展會不會增加成本？**
> 短時間看起來可能會增加，但通常是為了避免更大的故障成本與長期浪費。
### 相關術語

> - **AI負載平衡**：常和流量分配一起設計
> - **模型服務化**：模型服務化後也常要自動擴展
> - **金絲雀部署**：擴容後的新版本常先小流量驗證

---

來源：https://aiterms.tw/terms/auto-scaling
快查頁：https://aiterms.tw/terms/auto-scaling
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-auto-scaling