AI 主題集合

深度學習 術語大全

完整收錄 410 個 深度學習 相關 AI 術語,每個術語提供中英文定義、深度解說與 iPAS 考試重點分析。

機器人視覺(Computer Vision in Robotics)

機器人視覺是指機器人使用攝像頭和深度傳感器配合計算機視覺算法,感知和理解視覺世界,完成抓取、組裝、檢測等任務。它使機器人能在動態環境中自主操作,廣泛應用於製造、物流和醫療。

查看術語

紅綠藍色彩模型(RGB)

以紅(Red)、綠(Green)、藍(Blue)三原色疊加表示顏色的加法混色模型,是數位影像與電腦視覺任務中圖像表示的基礎格式。

查看術語

自駕車(Autonomous Vehicles)

自駕車是指無需人類駕駛員干預,能自主感知環境、做出決策和控制行駛的車輛。自駕系統整合了計算機視覺、傳感器融合、路徑規劃和深度學習,是 AI 應用中最複雜的系統。

查看術語

焦點損失函數(Focal Loss)

焦點損失函數 (Focal Loss) 是一種用於解決物件偵測中類別不平衡問題的損失函數,它通過降低易分類樣本的權重,使模型更關注難分類樣本。

查看術語

AI 氣候模型(Climate Modeling with AI)

AI 氣候模型是指使用機器學習加速和改進氣候模擬和預測的技術。AI 能從大規模氣象數據中學習複雜的氣候動態,提高預測準確性和計算效率,支持氣候變化研究和政策制定。

查看術語

資料擴增術(Data Augmentation)

資料擴增術是一種增加訓練資料多樣性的技術,透過對現有資料進行微小的修改,創造出新的、但仍然代表相同類別的資料點,以提升模型泛化能力。

查看術語

Sigmoid 函數(Sigmoid)

Sigmoid 函數是一種將任意實數壓縮到 (0, 1) 區間的 S 形曲線,公式為 σ(x) = 1/(1+e⁻ˣ),常作為神經網路的激活函數及邏輯斯迴歸的輸出層,用於將線性輸出轉換為機率值。

查看術語

控制網路(ControlNet)

ControlNet 是一種神經網路結構,用於控制大型擴散模型,例如 Stable Diffusion,以實現更精確的圖像生成控制,例如基於草圖或邊緣圖生成圖像。

查看術語

影像描述生成(Image Captioning)

影像描述生成(Image Captioning)是電腦視覺與自然語言處理的交叉任務,旨在讓模型自動為輸入影像產生自然語言描述,是多模態 AI 的核心應用之一,評估指標常用 BLEU、CIDEr、SPI

查看術語

生成式模型(Generative Model)

生成式模型(Generative Model)是能夠學習資料的機率分布並從中生成新樣本的機器學習模型,涵蓋 GAN、VAE、擴散模型等架構,廣泛應用於影像合成、文字生成與資料擴增。

查看術語

張量處理單元(TPU)

張量處理單元(TPU)是Google專為加速機器學習工作負載而設計的客製化硬體加速器,尤其擅長處理張量運算,是深度學習的利器。

查看術語

模型參數(Parameters)

模型參數是機器學習模型在訓練過程中學習到的數值,用於決定模型如何對輸入資料進行轉換和預測。它們是模型的內部變數。

查看術語

KL散度(KL Divergence)

KL散度(Kullback-Leibler Divergence)衡量兩個機率分佈的差異,數值越大代表分佈差異越大,常用於評估模型預測分佈與真實分佈的接近程度。

查看術語

移動網路(MobileNet)

MobileNet是一種針對移動和嵌入式設備設計的輕量級深度神經網路架構,旨在實現高效的資源利用和快速的推論速度。

查看術語

膠囊網路(Capsule Network)

膠囊網路是一種神經網路架構,旨在解決卷積神經網路在處理物件方向和空間關係上的不足,透過膠囊和路由機制,更有效地捕捉物件的層次結構。

查看術語

規模(Scale)

規模指AI系統中模型參數、訓練資料與運算資源的量級。擴展規模可顯著提升效能,是推動大型語言模型突破的關鍵因素。

查看術語

特徵圖(Feature Map)

特徵圖是卷積神經網絡中,經過卷積層運算後所產生的多維陣列,用於呈現輸入資料的特定局部特徵與空間結構。

查看術語

文字生成音訊(Text-to-Audio)

文字生成音訊(Text-to-Audio)是把一段文字描述直接轉成聲音的生成式 AI 技術,產出的是音樂、音效或環境音,不是唸稿的人聲。它跟文字轉語音(Text-to-Speech)最大的差別,在於生成的是整個聲音場景,還是單純的說話聲。

查看術語

位元微調(BitFit)

一種極致的參數高效微調方法,只訓練模型中偏置項(Bias)的某些位,相比全模型微調減少99.9%的訓練參數,成本極低但性能接近全參數微調。

查看術語

醫療 AI(Medical AI)

醫療 AI 是指應用於醫療診斷、治療和管理的人工智能技術。它使用機器學習和深度學習對醫學影像進行分析、輔助診斷、預測患者風險和個性化治療方案。

查看術語

輸出層(Output Layer)

神經網路最後一層,根據任務類型選擇合適的激活函數,將隱藏層的高維特徵轉換為最終預測結果(分類概率、迴歸值或其他形式),是模型與外界交互的界面。

查看術語

前綴調整法(Prefix Tuning)

前綴調整法是一種參數高效的微調技術,通過在輸入序列前添加可訓練的前綴向量,來引導預訓練模型生成期望的輸出,同時保持原始模型參數凍結。

查看術語

波形網路(WaveNet)

WaveNet是一種深度生成模型,直接對原始音訊波形進行建模,能夠生成高品質的語音和音樂,並在語音合成領域取得了顯著的成果。

查看術語

重排序模型(Reranking)

重排序模型是一種在初步檢索後,對候選結果進行重新排序的技術,旨在提升檢索結果的相關性和準確性,通常使用更複雜的模型。

查看術語

神經網路(Neural Network)

神經網路是模仿人類大腦神經元結構的機器學習模型,由多層節點(神經元)組成,透過加權求和與激活函數學習複雜的非線性關係

查看術語

雙向編碼器(Bidirectional Encoder)

能同時處理序列的前向和後向上下文,在每個位置都能看到完整序列信息的神經網路編碼器,相比單向模型提供更豐富的上下文表示,是 BERT 等預訓練模型的核心。

查看術語

對數損失(Log Loss)

對數損失(Log Loss)是交叉熵損失在二元分類問題中的特殊形式,衡量模型預測機率與真實標籤之間的差異,數值越小代表模型表現越好。

查看術語

混合正則化(Mixing Regularization)

混合正則化是一種透過組合兩個或多個訓練樣本及其標籤來生成新訓練數據的技術,藉此擴增資料集多樣性,有效減輕神經網路模型的過擬合現象並提升泛化能力。

查看術語

規模定律(Scaling Law)

規模定律描述了模型性能如何隨著模型大小、訓練數據量和計算資源的增加而變化。它提供了一種預測模型性能的經驗關係。

查看術語

預熱訓練(Warmup)

預熱訓練是一種在模型訓練初期,逐步提高學習率的策略,旨在穩定訓練過程,避免初期梯度爆炸或震盪。

查看術語

貪婪解碼(Greedy Decoding)

貪婪解碼是一種序列生成方法,在每個時間步選擇概率最高的詞作為輸出,直到生成終止符號或達到最大長度。它簡單快速,但可能陷入局部最佳解。

查看術語

藥物發現(Drug Discovery)

藥物發現是指使用 AI 和機器學習從海量化學分子中識別和優化具有治療潛力的藥物候選物。AI 可以加速分子篩選、性質預測和優化過程,將藥物開發週期從十年縮短為數年。

查看術語

遺忘門(Forget Gate)

長短期記憶網路(LSTM)的核心門機制,通過 sigmoid 激活函數產生 0-1 的控制信號,決定上一時步細胞狀態中有多少信息應被遺棄或保留,是解決梯度消失問題的關鍵元件。

查看術語

BLEU分數(BLEU Score)

BLEU分數是一種評估機器翻譯文本品質的指標,通過比較候選譯文與參考譯文的n-gram重疊程度來計算,數值越高表示翻譯品質越好。

查看術語

低秩適配(LoRA)

LoRA是一種參數高效的微調技術,透過學習低秩矩陣來適應預訓練模型,大幅減少訓練參數,降低計算成本。

查看術語

全連接層(Fully Connected Layer)

神經網路中每個神經元都與前一層所有神經元相連的層級,每條連接都有獨立的可學習權重,能進行高度非線性的特徵轉換,常用於網路最後階段進行分類或迴歸。

查看術語

光達資料處理(LiDAR Processing)

光達資料處理是指對雷射雷達感測器採集的三維點雲資料進行清理、分析與解釋的過程,旨在從中提取有意義的空間資訊,廣泛應用於自動駕駛、測繪與環境監測等領域。

查看術語

你只看一次(YOLO)

YOLO (You Only Look Once) 是一種即時物件偵測演算法,它將物件偵測視為一個迴歸問題,直接從完整圖像預測邊界框和類別機率。

查看術語

集束搜尋(Beam Search)

集束搜尋是一種啟發式搜尋演算法,用於序列預測任務,它在每個時間步保留多個最有可能的候選序列(集束),而非僅僅選擇最佳選項。

查看術語

輸入門(Input Gate)

長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。

查看術語

殘差網路(ResNet)

ResNet是一種深度學習模型,透過引入殘差連接解決深度神經網路訓練時的梯度消失問題,允許網路學習殘差映射而非直接映射。

查看術語

推論(Inference)

推論是指利用已訓練好的機器學習模型,對新的、未曾見過的資料進行預測或判斷的過程。是模型部署後的核心環節。

查看術語

抓取規劃(Grasp Planning)

抓取規劃是機器人學中的核心技術,旨在為機器人手臂規劃出有效且穩定的抓取動作,以成功拾取、移動或操作物體,確保任務執行效率與安全性。

查看術語

羊駝語言模型(LLaMA)

LLaMA(Large Language Model Meta AI)是 Meta 開發的開放權重(open-weight)大型語言模型系列,可免費下載、修改、自行部署,採 Meta 自訂 community license 授權,非 OSI 認證開源。

查看術語

隱藏狀態(Hidden State)

隱藏狀態是神經網路中用於儲存與傳遞歷史資訊的內部記憶向量,負責在處理序列資料時保留上下文特徵,協助模型理解時序依賴關係。

查看術語

圖形處理器(GPU)

圖形處理器(GPU)是一種專為並行處理設計的電子電路,最初用於加速圖像渲染,現廣泛應用於深度學習等需要大量計算的領域。

查看術語

光學字元辨識(OCR)

光學字元辨識(OCR)是一種技術,能將圖像中的文字轉換為機器可讀的文字格式,例如將掃描文件轉換為可編輯的文字。

查看術語

文本到文本(T5)

T5 (Text-to-Text Transfer Transformer) 是一種將所有 NLP 任務轉換為文本到文本格式的轉換器模型,簡化了模型訓練和應用。

查看術語

卷積層(Convolutional Layer)

神經網路中利用卷積運算自動提取局部特徵的層級,通過多個小尺寸濾波器滑動掃描輸入數據,能有效減少參數數量並增強空間特徵學習能力。

查看術語

解碼器(Decoder)

解碼器是神經網路的一部分,負責將編碼器產生的抽象向量表示,轉換成人類可理解的目標輸出,如文字、圖片或語音。

查看術語

深度Q網路(Deep Q-Network)

深度Q網路(DQN)是一種結合深度學習與Q學習的強化學習演算法,利用深度神經網路逼近Q函數,解決高維度狀態空間的強化學習問題。

查看術語

圖像識別(Image Recognition)

圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。

查看術語

適配器模組(Adapter)

適配器模組是一種輕量級的模型微調方法,透過在預訓練模型中插入少量可訓練參數,以適應特定任務,同時保持原始模型參數凍結。

查看術語

曼巴模型(Mamba)

Mamba是一種基於選擇機制的序列模型,旨在解決Transformer在長序列建模上的效率瓶頸,透過硬體感知演算法提升運算速度。

查看術語

錨框(Anchor Box)

錨框(Anchor Box)是在目標檢測中預先定義的一系列具有不同大小和長寬比的矩形框,用於在圖像中生成候選區域,以便模型進行目標分類和邊界框回歸。

查看術語

輸出門(Output Gate)

長短期記憶網路(LSTM)的門控機制之一,通過 sigmoid 激活函數產生 0-1 的信號,決定細胞狀態中有多少信息應被輸出至隱藏狀態,控制網路對外部環境的信息交互程度。

查看術語

微調(Fine-tuning)

微調是在預訓練模型基礎上,以少量特定領域資料繼續訓練,使通用模型適應特定任務需求,提升性能。

查看術語

節點嵌入(Node Embedding)

節點嵌入是一種將圖形結構中的節點轉換為低維度連續向量的技術,目的是保留節點在原圖中的網絡拓樸與特徵資訊,以便於後續進行各類機器學習任務。

查看術語

金融 AI(Financial AI)

金融 AI 是指應用於金融市場預測、風險管理、詐欺偵測和投資決策的人工智能技術。它使用機器學習分析大量財務數據和市場信號,提升交易策略的性能和降低風險。

查看術語

地理空間AI(Geospatial AI)

地理空間AI結合人工智慧與地理空間資料,分析地球表面現象,從衛星影像、地圖和感測器數據中提取洞察,支援智慧城市、環境監測等應用。

查看術語

線性整流函數(ReLU)

線性整流函數(Rectified Linear Unit, ReLU)是深度學習中最常用的激活函數,將負值輸出設為零、正值保持不變,有效解決梯度消失問題並加速神經網路收斂。

查看術語

訓練輪次(Epoch)

Epoch(訓練輪次)是模型完整遍歷一次訓練資料集的過程;訓練輪次數量影響模型效果,過多會造成過擬合,過少會導致欠擬合。

查看術語

U型網路(U-Net)

U-Net是一種用於圖像分割的深度學習模型,其架構呈U型,包含編碼器和解碼器,能有效捕捉圖像的上下文資訊和精確定位分割邊界。

查看術語

圖池化(Graph Pooling)

圖池化是一種減少圖形結構資料維度與節點數量的技術,用以提取全域特徵,降低計算成本,在圖神經網路中扮演關鍵的降維角色。

查看術語

深度學習 概念比較

常見問題

深度學習 是什麼?

本頁依已發布術語的主題標記,整理 410 個 深度學習 相關概念。

深度學習 有哪些核心術語?

流匹配、詞義消歧、稀疏注意力機制、機器人視覺、語音助理

深度學習 相關術語在 iPAS 考試中重要嗎?

本頁有 54 個術語標記為 iPAS 相關。