資料與數據 Data
資料是機器學習模型的學習基礎,包含結構化與非結構化形式,驅動 AI 系統發展。
瀏覽 AITerms.tw 中標籤為「資料處理」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
資料是機器學習模型的學習基礎,包含結構化與非結構化形式,驅動 AI 系統發展。
資料標註是為資料集添加標籤或註解的過程,使機器學習模型能夠理解和學習這些資料,是模型訓練的基礎。
資料擴增術是一種增加訓練資料多樣性的技術,透過對現有資料進行微小的修改,創造出新的、但仍然代表相同類別的資料點,以提升模型泛化能力。
描述資料集來源、組成、預期用途、限制與潛在偏誤的文件。
資料漂移是指模型上線後,輸入資料的分布與訓練資料不同,進而造成模型預測效能降低的現象
資料不平衡指訓練資料中各類別樣本數量差異懸殊,導致模型傾向預測多數類別,常用 SMOTE 過採樣或欠採樣等技術來處理
資料填補是處理遺失值的方法,透過統計方法估算並替換遺失值,以維持資料完整性,避免分析偏差。
資料標註是指為原始資料添加標籤的過程,這些標籤提供關於資料的額外資訊,用於訓練監督式機器學習模型。
資料湖是一種大型集中式儲存庫,能以原始格式存放結構化、半結構化和非結構化的各式資料,提供高度彈性與可擴展性。
資料洩漏(Data Leakage)是指模型訓練過程中,未來或測試集的資訊意外滲入訓練集,導致模型在評估時表現虛高,但部署後實際效能大幅下滑的現象。
資料血緣追蹤記錄資料從來源到目的地的流動和轉換,提供資料的完整歷史和上下文,確保資料品質和可追溯性。
資料並行是一種分散式訓練方法,將資料分割成多份,分配給多個節點,每個節點使用相同模型副本訓練不同資料子集。
資料管線是一系列資料處理步驟,將原始資料轉換為可供分析或模型使用的格式,包含擷取、轉換、載入等階段。
資料投毒攻擊是一種惡意攻擊,攻擊者將惡意或錯誤的資料注入到訓練資料集中,以影響機器學習模型的性能或行為。攻擊目標是使模型產生錯誤的預測或執行其他有害操作。
資料前處理是指在將原始資料用於機器學習模型之前,對其進行清理、轉換和整合的過程,以提高模型效能和準確性。
資料品質監控是指持續追蹤和評估資料的準確性、完整性、一致性、時效性和有效性,以確保資料符合預期標準。
將大規模資料集水平切割為多個獨立區塊,以提升平行處理效率與降低記憶體負荷。
資料驗證是確保機器學習模型訓練與推論資料之準確性、完整性與格式正確性的自動化檢查過程,能有效防止異常數據污染系統。
資料版本控制是一種管理機器學習專案中資料集與模型異動的技術,確保實驗的可重複性與團隊協作效率。
資料版本控制追蹤資料集在不同時間點的狀態,確保可重複性、可追溯性,並允許回復到先前的資料版本。
資料倉儲是針對查詢與分析優化的結構化資料儲存系統,整合多來源資料以支援商業智慧決策
密度型空間分群演算法(Density-Based Spatial Clustering of Applications with Noise, DBSCAN)是一種基於資料點鄰域密度進行分群的演算法,
依存句法分析是自然語言處理中,分析句子中詞彙之間的依存關係,建立句子的語法結構,揭示詞彙間的修飾、支配等關係。
指感測器或裝置隨時間產生資料分佈變化的現象,影響模型效能。
差分隱私是一種資料匿名化技術,透過在統計查詢結果中注入隨機噪音,在公開資料的同時保護個別資料點的隱私。
透過收集設備或用戶的多種可識別資訊,建立獨特且穩定的識別碼。
數位分身是真實世界實體或系統的虛擬化身,通過收集數據進行模擬、監控和預測,以優化性能、預防故障和做出更明智的決策。
降維處理旨在減少資料集的特徵數量,同時保留重要資訊,以簡化模型、加速運算並避免維度災難。
直接侵權指未經授權而直接複製、散布或使用受版權保護作品的行為,在AI領域涉及模型訓練與輸出。
透過部署在廣大空間中的多個智慧感測器節點協同合作,收集並分析環境與系統狀態的分散式資料處理技術。
分散式訓練利用多個計算節點,將模型訓練任務分割並行處理,加速大型模型訓練,提升效率。
DNA序列分析是計算生物學領域的關鍵技術,旨在解讀、比較和理解生物體的遺傳信息,對於疾病診斷、藥物開發和演化研究至關重要。
AI藥物發現利用人工智慧加速藥物研發流程,從靶點識別、候選藥物篩選、臨床試驗設計到藥物重定位,降低成本並縮短開發週期。