資料標註 Data Annotation
資料標註是為資料集添加標籤或註解的過程,使機器學習模型能夠理解和學習這些資料,是模型訓練的基礎。
查詢 Transformer、RAG、AI Agent 等 AI 術語,包含定義、iPAS 考點分析、常見問題與 Markdown 版本。
資料標註是為資料集添加標籤或註解的過程,使機器學習模型能夠理解和學習這些資料,是模型訓練的基礎。
資料漂移是指模型上線後,輸入資料的分布與訓練資料不同,進而造成模型預測效能降低的現象
資料不平衡指訓練資料中各類別樣本數量差異懸殊,導致模型傾向預測多數類別,常用 SMOTE 過採樣或欠採樣等技術來處理
資料洩漏(Data Leakage)是指模型訓練過程中,未來或測試集的資訊意外滲入訓練集,導致模型在評估時表現虛高,但部署後實際效能大幅下滑的現象。
資料血緣追蹤記錄資料從來源到目的地的流動和轉換,提供資料的完整歷史和上下文,確保資料品質和可追溯性。
只收集、處理和保存完成特定目的所必要之最少個人資料的隱私設計原則。
資料隱私是指保護個人資訊不被未授權存取、蒐集或濫用的原則與實踐,在 AI 系統中需遵循 PDPA 等法規要求
資料驗證是確保機器學習模型訓練與推論資料之準確性、完整性與格式正確性的自動化檢查過程,能有效防止異常數據污染系統。
資料版本控制是一種管理機器學習專案中資料集與模型異動的技術,確保實驗的可重複性與團隊協作效率。
資料視覺化是將資料轉換為圖表、圖形等視覺形式的技術,幫助人們更直觀地理解資料模式、趨勢與異常,常用工具包括 Matplotlib、Tableau、Power BI
解碼器是神經網路的一部分,負責將編碼器產生的抽象向量表示,轉換成人類可理解的目標輸出,如文字、圖片或語音。
深度學習模型架構設計,僅使用解碼器(Decoder)層進行文本生成和處理,無需編碼器,通過因果遮蔽使模型只能關注當前位置的歷史信息,實現自迴歸文本生成。
僅解碼器模型是一種專注於自迴歸生成的架構,透過預測下一個詞彙來產生連續文本,為現代語言模型的核心。
深度協同過濾結合深度學習與協同過濾,利用神經網路學習使用者和物品的隱藏表示,以提升推薦準確度,尤其在處理複雜互動模式時。
利用深度神經網路學習用戶與物品的複雜非線性互動,自動提取高階特徵,實現精細化個性化推薦。
結合深度神經網路與Q學習的強化學習算法,能在高維狀態空間中進行最優決策。
深度Q網路(DQN)是一種結合深度學習與Q學習的強化學習演算法,利用深度神經網路逼近Q函數,解決高維度狀態空間的強化學習問題。
深度偽造是利用深度學習技術合成的逼真音訊、圖像或影片,通常用於製造假新聞、詐騙或惡意中傷。
深度偽造偵測旨在辨識經由深度學習技術偽造或操縱的影音內容,以防止不實資訊傳播和維護資訊真實性。
密度分群是一種基於資料分布密度的分群方法,它能找出任意形狀的群集,並自動識別出噪訊
從2D影像推斷場景的3D深度資訊,用於3D重建、機器人導航、AR應用和自動駕駛。
在多輪對話中自動追蹤和維護對話狀態(如用戶意圖、槽值),支持對話管理和任務完成。
差分隱私是一種資料匿名化技術,透過在統計查詢結果中注入隨機噪音,在公開資料的同時保護個別資料點的隱私。
透過收集設備或用戶的多種可識別資訊,建立獨特且穩定的識別碼。
利用非對稱加密技術驗證電子文件真實性與完整性的密碼學機制。
直接偏好優化(DPO)是一種直接利用人類偏好資料,優化語言模型,無需訓練獎勵模型的強化學習替代方案。
研究超越句子層級的文本結構、連貫性與邏輯關係的語言分析方法。
判別式 AI 學習輸入與輸出之間的條件機率 P(Y|X),直接預測分類或回歸結果,與生成式 AI 學習資料分佈 P(X) 相對
透過部署在廣大空間中的多個智慧感測器節點協同合作,收集並分析環境與系統狀態的分散式資料處理技術。
分散式訓練利用多個計算節點,將模型訓練任務分割並行處理,加速大型模型訓練,提升效率。
模型訓練時的資料分布與部署後實際遇到的資料分布不同,導致模型效能下降的現象。
訓練資料與測試資料來自不同的統計分布或應用環境,導致模型性能下降的現象。
兩個向量逐元素相乘後加總的純量值,衡量向量間的相似程度與方向一致性。
隨機失活遮罩在訓練時動態產生隨機二元矩陣,將部分神經元輸出暫時歸零,以打破特徵依賴並防止模型過度擬合。
利用互逆任務(如中翻英與英翻中)之間的結構對稱性,建構閉環反饋系統以提升機器學習效能的無監督訓練框架。