---
title: "時序Transformer（Transformer for Time Series）"
slug: transformer-for-time-series
language: zh-TW
source: https://aiterms.tw/terms/transformer-for-time-series
updated_at: 2026-06-23
tags: [深度學習, 時序分析, 機器學習, AI應用]
ipas_term: false
---

# 時序Transformer（Transformer for Time Series）

將Transformer架構應用於時序資料，利用自注意力捕捉時間依賴，在預測任務上取得優異成績。

## 完整說明

時序Transformer是將Transformer自注意力機制應用於時間序列預測和分析的深度學習模型。Transformer最初用於自然語言處理，以其並行性強、長距離依賴學習能力而著稱。在時序預測領域，Transformer突破了RNN和LSTM的順序計算限制，支援平行處理整個序列，並通過自注意力學習序列中任意位置間的動態依賴。相比傳統的LSTM和TCN，時序Transformer在股票預測、能源負載、天氣預報等任務上展現優異性能，成為時序預測的新標準方法。

## 常見問題

### 時序Transformer怎樣處理超長序列（數千或更長時間步驟）？

純Transformer的O(n²)複雜度使超長序列的計算成本和記憶成本不可承受。應對策略包括：（1）分割序列，用滑動窗口逐段處理，如只用過去100個時間步驟預測未來；（2）稀疏注意力，只計算特定位置間的注意力（如局部注意力+全局注意力）；（3）線性Transformer變體，將自注意力複雜度降低到O(n)；（4）低秩近似，用低秩矩陣近似完整注意力矩陣。實務中，分割序列是最簡單實用的方法。

### 位置編碼對時序Transformer有多重要？

位置編碼至關重要。沒有位置編碼，Transformer對序列重排列不敏感，無法區分時間順序。正弦-餘弦位置編碼的特性：（1）為不同位置生成不同向量；（2）相對位置有規律（位置i和j的編碼向量內積決定於相對距離j-i）。這使模型能學習相對時間關係。實驗表明，用固定編碼訓練的模型推理時泛化到不同序列長度的能力強於可學習編碼。選擇合適的編碼方案對性能影響顯著。

### 時序Transformer和標準Transformer在結構上有什麼區別？

標準Transformer（如NLP中的BERT）有編碼器和解碼器，輸入是詞序列，輸出是詞表上的概率。時序Transformer通常採用簡化架構：只有編碼器，輸入是時間序列數值，輸出是預測值或異常分數。某些變體如Informer使用稀疏注意力和金字塔結構降低複雜度。另外，時序Transformer往往在attention層後加線性層直接輸出預測，而非複雜的解碼過程。設計應根據具體預測任務（點預測、區間預測、概率預測）靈活調整。

---

來源：https://aiterms.tw/terms/transformer-for-time-series
快查頁：https://aiterms.tw/terms/transformer-for-time-series
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-transformer-for-time-series