---
title: "災難性遺忘（Catastrophic Forgetting）"
slug: catastrophic-forgetting
language: zh-TW
source: https://aiterms.tw/terms/catastrophic-forgetting
updated_at: 2026-06-23
tags: [機器學習, 深度學習, AI基礎]
ipas_term: false
---

# 災難性遺忘（Catastrophic Forgetting）

神經網路在學習新知識時快速遺忘舊知識的現象，導致之前習得的能力消失。

## 完整說明

災難性遺忘（Catastrophic Forgetting，也稱 Catastrophic Interference）是深度學習中的核心問題。當訓練序列中的新任務時，模型參數的更新會大幅改變舊任務的效能。這不是正常的記憶衰減，而是快速和完全的性能崩潰。例如，人類學新語言時可能暫時忘記舊語言用法，但神經網路的遺忘更徹底：舊任務準確率可能從 95% 瞬間跌到 10%。

## 常見問題

### 為什麼簡單地保留舊資料進行重訓練不是解決遺忘的好方法？

簡單重訓練雖然理論上可行，但實務上有三個問題。首先，舊資料可能因隱私或儲存限制無法保留。其次，完整重訓練計算成本極高，對於持續學習的線上系統不現實。最後，隨著任務堆積，每次都重訓練舊任務會導致計算成本呈線性增長。例如，第 100 個新任務來臨時，已經需要訓練 100 個任務了，系統變得不可用。這是為什麼需要發展防遺忘技術而不是簡單重訓練。

### 不同的神經網路架構（CNN、RNN、Transformer）是否都會遭遇災難性遺忘？

是的，所有基於參數共享的深度網路都會遭遇災難性遺忘，包括 CNN、RNN、Transformer。遺忘的根本原因是參數在高維空間中的衝突，與具體架構無關。不過，不同架構的遺忘程度可能差異很大。Transformer 因為有大量參數和注意力機制的靈活性，可能比卷積網路更容易找到兼容的參數區域。循環網路的時間維度會加重遺忘問題。但無論如何，若不採取防遺忘策略，任何架構都無法避免。

### 為什麼在高維參數空間中兩個任務的最優點往往不相容？

這涉及高維空間的幾何特性。在低維空間（1-2 維），兩個函數的最優點可能相近或重合。但在高維空間（如數百萬維），隨機選擇的兩個點幾乎肯定相距很遠。神經網路的最優點也是如此。任務 1 和任務 2 各自在參數空間中形成自己的最優盆地（loss landscape）。這兩個盆地通常不重合，距離很遠。從任務 1 的最優點朝任務 2 優化時，必須遠離任務 1 的最優點，導致任務 1 的損失上升，即遺忘。只有當兩個任務高度相似時，它們的最優點才可能接近。

---

來源：https://aiterms.tw/terms/catastrophic-forgetting
快查頁：https://aiterms.tw/terms/catastrophic-forgetting
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-catastrophic-forgetting