---
title: "提示微調（Prompt Tuning）"
slug: prompt-tuning
language: zh-TW
source: https://aiterms.tw/terms/prompt-tuning
updated_at: 2026-06-23
tags: [參數高效, 提示學習, 微調, 深度學習]
ipas_term: false
---

# 提示微調（Prompt Tuning）

一種輕量級的模型適配方法，通過學習可訓練的向量嵌入來優化輸入提示，而不修改模型權重，特別適合大規模語言模型。

## 完整說明

提示微調（Prompt Tuning）是一種將模型權重完全凍結，只優化輸入層的可訓練參數的微調方法。具體地，它在原始輸入前添加虛擬標記（Virtual Tokens）或可訓練的連續向量，通過梯度下降學習這些向量使模型輸出匹配目標任務。相比於傳統的微調修改百萬甚至億級參數，提示微調只需訓練幾千個輸入層參數。提示微調特別適合超大規模預訓練模型（如 T5），在許多任務上達到接近全參數微調的性能，同時訓練速度快、可共享微調過程。

## 常見問題

### 為什麼提示微調能用這麼少的參數達到接近全參數微調的性能？

這源於遷移學習的能力。預訓練模型已經學會了通用知識，微調過程本質上只是「告訴模型」「對這個任務做什麼」。提示是這個「告訴」過程的載體，通過優化幾千個提示參數就能引導模型應用已有知識到新任務。實驗觀察顯示，大模型的優化過程中，參數更新通常集中在較低秩子空間，提示微調恰好優化了這個子空間的輸入投影。換個角度，如果把模型視為函數 f_θ(x)，全參數微調改變 θ，提示微調改變 x。對於良好泛化的預訓練模型，改變 x 往往足夠有效，相當於利用模型已有的多樣化特徵。

### 軟標記的數量如何選擇？是否越多越好？

軟標記數量 m 影響模型適配的靈活性與過擬合風險。太少（如 m=5）表達能力受限，特別複雜任務可能無法完全適配；太多（如 m=500）雖然理論上更靈活，但面臨過擬合，特別在數據少時。一般建議：小模型 m=20-50，中等模型 m=50-100，大模型 m=100-200。更精確的選擇可以通過驗證集性能評估：從 m=20 開始，逐步增加，當驗證性能不再改進時停止。另一個啟發式是讓軟標記數佔序列長度的 5-10%，即序列長 512 時 m=25-50。實驗發現，不同任務最優 m 差異較大，沒有普適值，需要小規模預實驗確定。

### 提示微調的軟標記初始化對性能影響有多大？

初始化對提示微調影響較大，特別是數據少時。隨機初始化通常需要更多訓練步數收斂；從預訓練嵌入採樣初始化（如從訓練集詞彙隨機選擇幾個詞的嵌入作為初始軟標記）能加快收斂 2-3 倍，最終性能也高 1-2%。這是因為好的初始化提供了語義信號，模型不必從零開始學習。先進的初始化策略包括：（1）從訓練數據高頻詞的嵌入初始化；（2）聚類初始化，用 K-means 聚類訓練數據的嵌入，用聚類中心初始化軟標記；（3）任務相關初始化，用與任務相關詞彙的嵌入初始化。實踐中，簡單的隨機採樣預訓練嵌入初始化通常效果就不錯，複雜初始化策略的收益邊際遞減。

---

來源：https://aiterms.tw/terms/prompt-tuning
快查頁：https://aiterms.tw/terms/prompt-tuning
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-prompt-tuning