---
title: "解碼器唯一架構（Decoder-only Architecture）"
slug: decoder-only-architecture
language: zh-TW
source: https://aiterms.tw/terms/decoder-only-architecture
updated_at: 2026-06-22
tags: [深度學習, 自然語言處理, 大型語言模型, 生成式AI]
ipas_term: false
---

# 解碼器唯一架構（Decoder-only Architecture）

深度學習模型架構設計，僅使用解碼器（Decoder）層進行文本生成和處理，無需編碼器，通過因果遮蔽使模型只能關注當前位置的歷史信息，實現自迴歸文本生成。

## 完整說明

解碼器唯一架構是一種簡化的 Transformer 設計，完全捨棄編碼器，只使用解碼器層進行序列建模和文本生成。通過因果自注意力（causal self-attention）遮蔽未來位置，使模型在生成每個詞時只能看到過去的信息，實現自然的自迴歸生成流程。GPT 系列模型採用此架構，憑藉其簡潔性和生成效能，已成為大型語言模型的標準選擇，在零樣本學習、少樣本學習等領域表現優異。

## 常見問題

### 解碼器唯一模型如何進行文本理解任務（如分類）？

雖然解碼器唯一架構為生成設計，但通過巧妙的提示可執行理解任務。例如分類時，不直接預測類別 ID，而是指示模型生成類別名或 A/B/C 選項字符串。通過微調和 few-shot 示例，模型學會執行分類。不過，性能通常不如專門的理解模型（如 BERT）。大型語言模型的強大之處在於參數規模，足以在多個任務間泛化，而非架構本身的理解優勢。

### KV 快取如何優化解碼器推理的速度？

在自迴歸生成中，每步添加一個新詞，序列長度增加 1。不使用快取時，注意力需重新計算所有位置對（O(n²)），導致生成速度線性下降。KV 快取的原理是保存前面位置的 Key 和 Value，新詞只計算自己的 Query，再與快取的 K、V 進行點積，複雜度從 O(n²) 降至 O(n)。進一步優化（如多查詢注意力）可將複雜度降至 O(1)。實踐中，KV 快取能將推理速度提升 10-100 倍，是實時交互式應用（如聊天）的必要優化。

### 解碼器唯一模型為什麼在零樣本任務上表現好？

零樣本學習指在訓練時未見過該任務，推理時卻能完成。解碼器唯一模型的優勢來自於：1) 預訓練數據極其龐大和多樣，涵蓋了多種任務相關信息；2) 參數規模大（十億級以上），有足夠容量記憶和泛化知識；3) 通過恰當的提示（prompt）和上下文示例，激發模型的內在知識。這不是架構設計，而是規模和數據的紅利。相同規模的雙向編碼器在零樣本上也會表現良好。

---

來源：https://aiterms.tw/terms/decoder-only-architecture
快查頁：https://aiterms.tw/terms/decoder-only-architecture
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-decoder-only-architecture