主動學習 Active Learning
一種機器學習策略,由演算法主動選擇最具訊息價值的未標籤樣本進行標籤,以最小化標籤成本並最大化模型性能
瀏覽 AITerms.tw 中標籤為「資料處理」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
一種機器學習策略,由演算法主動選擇最具訊息價值的未標籤樣本進行標籤,以最小化標籤成本並最大化模型性能
人工智慧監管是指政府或相關機構制定和實施的,旨在規範人工智慧技術開發、部署和使用的法律、政策和指導方針,以確保其安全、公平和符合倫理。
變異數分析 (ANOVA) 是一種統計方法,用於比較兩個或多個群體的平均數是否存在顯著差異。它將總變異分解為不同來源的變異。
ARIMA是一種廣泛使用的時間序列預測模型,結合了自迴歸、差分和移動平均三個部分,用於分析和預測時間序列資料。
自動特徵工程利用演算法自動從原始資料中提取、選擇和轉換特徵,以提升機器學習模型的效能。
中央極限定理指出,大量獨立隨機變數的總和(或平均值)趨近於常態分佈,與原始變數的分佈無關。是統計推論的基石。
比較不同時間點的影像,識別地表或物件狀態的變化,廣泛應用於監測。
訓練資料中各類別樣本數量差異懸殊,導致模型偏向多數類的問題。
類別權重是一種機器學習技術,透過賦予少數類別較高權重來解決資料不平衡問題,提升模型對稀有事件的預測能力。
創用CC提供彈性版權許可,讓創作者分享作品,同時保留部分權利,促進知識共享與再利用。
信用評分是利用統計模型評估個人或企業的信用風險,預測其未來償還債務的能力,是金融機構決策的重要依據。
資料標註是為資料集添加標籤或註解的過程,使機器學習模型能夠理解和學習這些資料,是模型訓練的基礎。
資料漂移是指模型上線後,輸入資料的分布與訓練資料不同,進而造成模型預測效能降低的現象
資料血緣追蹤記錄資料從來源到目的地的流動和轉換,提供資料的完整歷史和上下文,確保資料品質和可追溯性。
差分隱私是一種資料匿名化技術,透過在統計查詢結果中注入隨機噪音,在公開資料的同時保護個別資料點的隱私。
透過部署在廣大空間中的多個智慧感測器節點協同合作,收集並分析環境與系統狀態的分散式資料處理技術。
分散式訓練利用多個計算節點,將模型訓練任務分割並行處理,加速大型模型訓練,提升效率。
圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。
標註者一致性衡量多位標註者在相同資料上標註結果的相似程度。高一致性代表標註品質良好,反之則可能需要重新評估標註規範。
迭代反向翻譯是一種自然語言處理技術,透過將目標語言翻譯回來源語言生成合成平行語料,並反覆交替訓練正反向模型以提升翻譯品質。
識別時間序列資料中重複出現的週期性模式,如每日、每週或每年循環。
指將感測器收集的原始訊號,透過濾波、校正與特徵提取,轉化為AI模型可用的結構化數據。
SentencePiece 是一種獨立於語言的分詞器,它將輸入視為 Unicode 字符序列,並使用 BPE 或 Unigram 算法生成詞彙表。
序列比對是計算生物學技術,用於找出生物序列間的相似區域,揭示演化關係或功能同源性。
稀疏檢索是一種資訊檢索方法,它使用稀疏向量來表示查詢和文檔,向量中的非零元素通常表示詞彙的存在或重要性。
合成資料生成是指透過程式或模型創建人工資料,用於訓練機器學習模型,尤其是在真實資料稀缺或難以獲取的情況下。
訓練模型時,不小心納入在預測時無法獲取的未來或結果資訊,導致模型過度樂觀。
分詞是自然語言處理(NLP)中的基礎步驟,旨在將連續的文本序列拆解成更小的、具有語義意義的單元,例如詞彙、子詞或字符,這些單元稱為 tokens。
訓練集是用於訓練機器學習模型的資料集,模型通過學習訓練集中的模式和關係來提升預測能力。
將時間序列資料拆解為趨勢、季節性與殘差成分,以揭示其潛在模式。