---
title: "長上下文（Long Context）"
slug: long-context
language: zh-TW
source: https://aiterms.tw/terms/long-context
updated_at: 2026-06-22
tags: [大型語言模型, 深度學習, 神經網路, AI基礎]
ipas_term: false
---

# 長上下文（Long Context）

指大型語言模型能夠處理和理解更長输入序列的能力，通常指支援數千到數百萬個 token 的上下文窗口。

## 完整說明

長上下文（Long Context）是現代大型語言模型的重要能力，指模型能夠有效處理更長的輸入序列。傳統模型的上下文窗口通常為 512 到 2048 個 token，而長上下文模型可支援 4096、8192、32768 甚至更多個 token。這使得模型能夠處理整部小說、長文檔、多輪對話等需要廣泛背景信息的任務。實現長上下文需要多項技術的結合，包括位置編碼優化、注意力機制改進、KV 快取優化等。

## 常見問題

### 為什麼實現長上下文這麼困難？

主要有三個層面的困難。計算層面：標準注意力的 O(n²) 複雜度在長序列上變得不可承受，從 8K 到 32K 序列，計算量增加 16 倍。記憶體層面：KV 快取的 O(n) 占用在 32K 序列上可達數十 GB，超過硬體限制。學習層面：更長的序列意味著更複雜的梯度流動和注意力模式，模型難以有效學習。這三個層面的問題需要系統地解決：優化注意力機制（稀疏、滑動窗口）、優化記憶體管理（量化、頁面注意力）、採用穩定的訓練策略（漸進式訓練）。

### 長上下文是否會影響模型在短序列上的性能？

通常不會。現代長上下文技術（如 RoPE + 外推、稀疏注意力等）在設計時會考慮向後相容性。訓練時即使使用長序列，模型在短序列上的性能基本不受影響，有時甚至因為更豐富的訓練信號而略有提升。例如，Mistral 7B 支援 8K 上下文，但在短序列基準（如 MMLU）上仍保持競爭力。重點是使用合理的注意力設計和位置編碼，避免不相容的修改。

### 長上下文模型推理時會變慢嗎？

取決於實現。如果使用稀疏注意力或滑動窗口，推理時的計算複雜度和速度與短序列相近。但如果用全注意力支援長序列（未來可能），推理速度會顯著下降，因為計算量 O(n²) 增長。另一個考慮是 KV 快取加載時間：更大的快取可能導致記憶體帶寬成為瓶頸。在實踐中，使用 vLLM 等優化框架的長上下文模型（如 Claude、GPT-4 Turbo）推理速度仍可接受，因為實現了量化、頁面注意力等優化。

---

來源：https://aiterms.tw/terms/long-context
快查頁：https://aiterms.tw/terms/long-context
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-long-context