類別特徵 Categorical Features
機器學習中取值為有限離散類別的特徵,如性別(男/女)、顏色(紅/綠/藍)、地區等,需要特殊編碼才能用於模型訓練
瀏覽 AITerms.tw 中標籤為「資料處理」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
機器學習中取值為有限離散類別的特徵,如性別(男/女)、顏色(紅/綠/藍)、地區等,需要特殊編碼才能用於模型訓練
因果推論是從觀察數據中推斷因果關係的方法,旨在確定一個變數的變化是否直接導致另一個變數的變化。
中央極限定理指出,大量獨立隨機變數的總和(或平均值)趨近於常態分佈,與原始變數的分佈無關。是統計推論的基石。
比較不同時間點的影像,識別地表或物件狀態的變化,廣泛應用於監測。
卡方檢定是一種統計方法,用於檢驗兩個或多個類別變數之間是否存在顯著關聯性。它比較觀察值與期望值之間的差異。
分塊處理是指將大型資料集或文本分割成更小、更易於管理的部分,以便於模型處理和分析,提升效率。
訓練資料中各類別樣本數量差異懸殊,導致模型偏向多數類的問題。
類別權重是一種機器學習技術,透過賦予少數類別較高權重來解決資料不平衡問題,提升模型對稀有事件的預測能力。
點擊率預測旨在預估使用者點擊特定廣告或連結的可能性,是數位廣告和推薦系統的核心技術。
冷啟動問題是指在推薦系統中,對於新使用者或新物品,由於缺乏足夠的互動資料,導致無法準確推薦的問題。常見解決方案包括利用元資料、內容過濾或混合推薦。
協同過濾是一種推薦系統技術,透過分析使用者行為或偏好,預測使用者可能感興趣的項目,例如商品、電影或音樂。
計算生物學結合電腦科學、統計學與生物學,利用演算法分析生物數據,以理解複雜的生物系統與過程。
內容過濾推薦是一種推薦系統方法,它基於用戶過去互動過的項目內容特徵,向用戶推薦相似的項目。它分析項目描述,並匹配用戶偏好。
凸優化是一種數學優化方法,旨在尋找凸函數在凸集合上的最小值。其優點是局部最小值即為全局最小值,易於求解。
語料庫是大量結構化的文本集合,用於語言研究和自然語言處理,提供真實語言使用的範例,用於訓練和評估模型。
相關係數衡量兩個變數之間線性關係的強度和方向,範圍從 -1 到 1。1 表示完全正相關,-1 表示完全負相關,0 表示沒有線性關係。
共變異數衡量兩個變數如何一起變化。正值表示它們趨於一起增加或減少,負值表示一個增加時另一個趨於減少,零值表示沒有線性關係。
創用CC提供彈性版權許可,讓創作者分享作品,同時保留部分權利,促進知識共享與再利用。
信用評分是利用統計模型評估個人或企業的信用風險,預測其未來償還債務的能力,是金融機構決策的重要依據。