AI 主題集合

模型訓練 術語大全

完整收錄 341 個 模型訓練 相關 AI 術語,每個術語提供中英文定義、深度解說與 iPAS 考試重點分析。

焦點損失函數(Focal Loss)

焦點損失函數 (Focal Loss) 是一種用於解決物件偵測中類別不平衡問題的損失函數,它通過降低易分類樣本的權重,使模型更關注難分類樣本。

查看術語

感知器(Perceptron)

感知器是最簡單的神經網路模型,模擬生物神經元,接收輸入、加權求和、通過激活函數輸出,用於二元分類。

查看術語

樸素貝氏(Naive Bayes)

樸素貝氏分類器是一種基於貝氏定理的簡單機率分類器。它假設所有特徵之間相互獨立,簡化了計算複雜度,因此得名「樸素」。常用於文本分類等任務。

查看術語

資料擴增術(Data Augmentation)

資料擴增術是一種增加訓練資料多樣性的技術,透過對現有資料進行微小的修改,創造出新的、但仍然代表相同類別的資料點,以提升模型泛化能力。

查看術語

控制網路(ControlNet)

ControlNet 是一種神經網路結構,用於控制大型擴散模型,例如 Stable Diffusion,以實現更精確的圖像生成控制,例如基於草圖或邊緣圖生成圖像。

查看術語

生成式模型(Generative Model)

生成式模型(Generative Model)是能夠學習資料的機率分布並從中生成新樣本的機器學習模型,涵蓋 GAN、VAE、擴散模型等架構,廣泛應用於影像合成、文字生成與資料擴增。

查看術語

張量處理單元(TPU)

張量處理單元(TPU)是Google專為加速機器學習工作負載而設計的客製化硬體加速器,尤其擅長處理張量運算,是深度學習的利器。

查看術語

模型參數(Parameters)

模型參數是機器學習模型在訓練過程中學習到的數值,用於決定模型如何對輸入資料進行轉換和預測。它們是模型的內部變數。

查看術語

KL散度(KL Divergence)

KL散度(Kullback-Leibler Divergence)衡量兩個機率分佈的差異,數值越大代表分佈差異越大,常用於評估模型預測分佈與真實分佈的接近程度。

查看術語

移動網路(MobileNet)

MobileNet是一種針對移動和嵌入式設備設計的輕量級深度神經網路架構,旨在實現高效的資源利用和快速的推論速度。

查看術語

學習率(Learning Rate)

學習率是機器學習模型訓練中的關鍵超參數,它決定了梯度下降演算法每次更新模型參數的步長與幅度,過大可能導致模型震盪,過小則會使收斂速度緩慢。

查看術語

膠囊網路(Capsule Network)

膠囊網路是一種神經網路架構,旨在解決卷積神經網路在處理物件方向和空間關係上的不足,透過膠囊和路由機制,更有效地捕捉物件的層次結構。

查看術語

規模(Scale)

規模指AI系統中模型參數、訓練資料與運算資源的量級。擴展規模可顯著提升效能,是推動大型語言模型突破的關鍵因素。

查看術語

提升算法(Boosting)

Boosting 是一種集成學習技術,透過迭代訓練一系列弱學習器,每個學習器都試圖糾正前一個學習器的錯誤,最終將它們組合起來形成一個強學習器。

查看術語

輸出層(Output Layer)

神經網路最後一層,根據任務類型選擇合適的激活函數,將隱藏層的高維特徵轉換為最終預測結果(分類概率、迴歸值或其他形式),是模型與外界交互的界面。

查看術語

前綴調整法(Prefix Tuning)

前綴調整法是一種參數高效的微調技術,通過在輸入序列前添加可訓練的前綴向量,來引導預訓練模型生成期望的輸出,同時保持原始模型參數凍結。

查看術語

語料庫(Corpus)

語料庫是大量結構化的文本集合,用於語言研究和自然語言處理,提供真實語言使用的範例,用於訓練和評估模型。

查看術語

波形網路(WaveNet)

WaveNet是一種深度生成模型,直接對原始音訊波形進行建模,能夠生成高品質的語音和音樂,並在語音合成領域取得了顯著的成果。

查看術語

自我對弈(Self-play)

自我對弈是一種強化學習技術,其中智能體與自身的副本進行對弈,從而學習和改進策略,無需外部人類或標記數據。

查看術語

對數損失(Log Loss)

對數損失(Log Loss)是交叉熵損失在二元分類問題中的特殊形式,衡量模型預測機率與真實標籤之間的差異,數值越小代表模型表現越好。

查看術語

合成數據(Synthetic Data)

合成數據是指通過程式或演算法生成的人工數據,而非從真實世界收集的數據。它常用於訓練AI模型,特別是在真實數據稀缺或涉及隱私問題時。

查看術語

混合正則化(Mixing Regularization)

混合正則化是一種透過組合兩個或多個訓練樣本及其標籤來生成新訓練數據的技術,藉此擴增資料集多樣性,有效減輕神經網路模型的過擬合現象並提升泛化能力。

查看術語

標籤偏誤(Label Bias)

標籤偏誤是指訓練資料的標註結果反映了人類主觀判斷或社會既有成見,導致資料標籤帶有系統性偏差,使AI模型學習到不公平的關聯。

查看術語

規模定律(Scaling Law)

規模定律描述了模型性能如何隨著模型大小、訓練數據量和計算資源的增加而變化。它提供了一種預測模型性能的經驗關係。

查看術語

貝氏最佳化(Bayesian Optimization)

貝氏最佳化是一種用於最佳化黑盒函數的演算法,它使用貝氏模型來建立目標函數的代理模型,並利用該模型來選擇下一個要評估的點,以在最少的迭代次數內找到最佳解。

查看術語

預熱訓練(Warmup)

預熱訓練是一種在模型訓練初期,逐步提高學習率的策略,旨在穩定訓練過程,避免初期梯度爆炸或震盪。

查看術語

貪婪解碼(Greedy Decoding)

貪婪解碼是一種序列生成方法,在每個時間步選擇概率最高的詞作為輸出,直到生成終止符號或達到最大長度。它簡單快速,但可能陷入局部最佳解。

查看術語

遺忘門(Forget Gate)

長短期記憶網路(LSTM)的核心門機制,通過 sigmoid 激活函數產生 0-1 的控制信號,決定上一時步細胞狀態中有多少信息應被遺棄或保留,是解決梯度消失問題的關鍵元件。

查看術語

ZeRO 優化(ZeRO Optimization)

Microsoft 提出的分布式訓練優化技術,通過將梯度、優化器狀態和模型參數分片存儲在多個 GPU 上,大幅降低記憶體占用,支持訓練超大規模模型。

查看術語

低秩適配(LoRA)

LoRA是一種參數高效的微調技術,透過學習低秩矩陣來適應預訓練模型,大幅減少訓練參數,降低計算成本。

查看術語

邏輯迴歸(Logistic Regression)

邏輯迴歸是一種廣義線性模型,用於預測二元或多元分類結果的機率。它使用 Sigmoid 函數將線性組合轉換為機率值,並透過最大似然估計來訓練模型。

查看術語

全連接層(Fully Connected Layer)

神經網路中每個神經元都與前一層所有神經元相連的層級,每條連接都有獨立的可學習權重,能進行高度非線性的特徵轉換,常用於網路最後階段進行分類或迴歸。

查看術語

你只看一次(YOLO)

YOLO (You Only Look Once) 是一種即時物件偵測演算法,它將物件偵測視為一個迴歸問題,直接從完整圖像預測邊界框和類別機率。

查看術語

集束搜尋(Beam Search)

集束搜尋是一種啟發式搜尋演算法,用於序列預測任務,它在每個時間步保留多個最有可能的候選序列(集束),而非僅僅選擇最佳選項。

查看術語

輸入門(Input Gate)

長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。

查看術語

數位分身(Digital Twin)

數位分身是真實世界實體或系統的虛擬化身,通過收集數據進行模擬、監控和預測,以優化性能、預防故障和做出更明智的決策。

查看術語

資料投毒攻擊(Data Poisoning)

資料投毒攻擊是一種惡意攻擊,攻擊者將惡意或錯誤的資料注入到訓練資料集中,以影響機器學習模型的性能或行為。攻擊目標是使模型產生錯誤的預測或執行其他有害操作。

查看術語

隨機搜尋(Random Search)

隨機搜尋是一種超參數最佳化方法,它在預定義的超參數空間中隨機選擇參數組合,並評估其性能,以找到最佳的超參數配置。

查看術語

殘差網路(ResNet)

ResNet是一種深度學習模型,透過引入殘差連接解決深度神經網路訓練時的梯度消失問題,允許網路學習殘差映射而非直接映射。

查看術語

羊駝語言模型(LLaMA)

LLaMA(Large Language Model Meta AI)是 Meta 開發的開放權重(open-weight)大型語言模型系列,可免費下載、修改、自行部署,採 Meta 自訂 community license 授權,非 OSI 認證開源。

查看術語

拉普拉斯平滑(Laplace Smoothing)

拉普拉斯平滑(Laplace Smoothing)又稱加一平滑,是貝氏統計中避免零機率問題的技術,在計算類別條件機率時,將每個類別的計數加上常數 α(通常為 1),防止訓練集未見過的詞彙或特徵使整個機

查看術語

圖形處理器(GPU)

圖形處理器(GPU)是一種專為並行處理設計的電子電路,最初用於加速圖像渲染,現廣泛應用於深度學習等需要大量計算的領域。

查看術語

文本到文本(T5)

T5 (Text-to-Text Transfer Transformer) 是一種將所有 NLP 任務轉換為文本到文本格式的轉換器模型,簡化了模型訓練和應用。

查看術語

鞍點(Saddle Point)

函數曲面上在某方向為局部最大值,在另一方向為局部最小值之點,形似馬鞍。在最佳化中,理解收斂行為的關鍵概念。

查看術語

卷積層(Convolutional Layer)

神經網路中利用卷積運算自動提取局部特徵的層級,通過多個小尺寸濾波器滑動掃描輸入數據,能有效減少參數數量並增強空間特徵學習能力。

查看術語

隨機過採樣(Random Oversampling)

隨機過採樣(Random Oversampling)是處理類別不平衡問題的技術,透過隨機複製少數類別的現有樣本,使各類別的訓練樣本數趨於平衡,讓模型對少數類別有足夠的學習機會,但有增加過擬合風險的疑慮

查看術語

正則化(Regularization)

正則化是一種在機器學習中用於防止模型過度擬合的關鍵技術,它透過在損失函數中引入懲罰項,有效限制模型參數的複雜度,從而提升模型的泛化能力。

查看術語

深度Q網路(Deep Q-Network)

深度Q網路(DQN)是一種結合深度學習與Q學習的強化學習演算法,利用深度神經網路逼近Q函數,解決高維度狀態空間的強化學習問題。

查看術語

圖像識別(Image Recognition)

圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。

查看術語

對偶學習(Dual)

利用互逆任務(如中翻英與英翻中)之間的結構對稱性,建構閉環反饋系統以提升機器學習效能的無監督訓練框架。

查看術語

適配器模組(Adapter)

適配器模組是一種輕量級的模型微調方法,透過在預訓練模型中插入少量可訓練參數,以適應特定任務,同時保持原始模型參數凍結。

查看術語

曼巴模型(Mamba)

Mamba是一種基於選擇機制的序列模型,旨在解決Transformer在長序列建模上的效率瓶頸,透過硬體感知演算法提升運算速度。

查看術語

輸出門(Output Gate)

長短期記憶網路(LSTM)的門控機制之一,通過 sigmoid 激活函數產生 0-1 的信號,決定細胞狀態中有多少信息應被輸出至隱藏狀態,控制網路對外部環境的信息交互程度。

查看術語

泛化能力(Generalization)

泛化能力是指機器學習模型在未見過的數據上表現良好的能力。一個具有良好泛化能力的模型能夠從訓練數據中學習到普遍規律,並應用於新數據。

查看術語

微調(Fine-tuning)

微調是在預訓練模型基礎上,以少量特定領域資料繼續訓練,使通用模型適應特定任務需求,提升性能。

查看術語

偏差(Bias)

偏差是模型對特定族群或特徵產生系統性錯誤傾向,源自訓練資料不平衡或演算法設計缺陷

查看術語

線性整流函數(ReLU)

線性整流函數(Rectified Linear Unit, ReLU)是深度學習中最常用的激活函數,將負值輸出設為零、正值保持不變,有效解決梯度消失問題並加速神經網路收斂。

查看術語

訓練輪次(Epoch)

Epoch(訓練輪次)是模型完整遍歷一次訓練資料集的過程;訓練輪次數量影響模型效果,過多會造成過擬合,過少會導致欠擬合。

查看術語

自助聚合(Bagging)

Bagging (Bootstrap Aggregating) 是一種集成學習技術,透過對原始資料集進行多次有放回的抽樣,訓練多個模型,並將它們的預測結果進行平均或投票。

查看術語

對齊校準(Alignment)

對齊校準是指使AI模型,特別是大型語言模型,的行為與人類意圖、價值觀和倫理規範相符的過程,降低潛在風險。

查看術語

冷啟動問題(Cold Start Problem)

冷啟動問題是指在推薦系統中,對於新使用者或新物品,由於缺乏足夠的互動資料,導致無法準確推薦的問題。常見解決方案包括利用元資料、內容過濾或混合推薦。

查看術語

模型訓練 概念比較

常見問題

模型訓練 是什麼?

本頁依已發布術語的主題標記,整理 341 個 模型訓練 相關概念。

模型訓練 有哪些核心術語?

決策樹、演員-評論家、文字生成3D模型、隨機梯度下降、光流估計

模型訓練 相關術語在 iPAS 考試中重要嗎?

本頁有 65 個術語標記為 iPAS 相關。