詞袋模型 Bag of Words
詞袋模型是一種簡化文本表示的方法,忽略詞語的順序和語法結構,僅統計每個詞語在文本中出現的次數,形成詞頻向量。
自然語言處理機器學習資料處理
瀏覽 AITerms.tw 中標籤為「資料處理」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
詞袋模型是一種簡化文本表示的方法,忽略詞語的順序和語法結構,僅統計每個詞語在文本中出現的次數,形成詞頻向量。
批次推論是指將大量資料一次性輸入模型進行預測,適用於對延遲不敏感的場景,例如定期報表生成或離線資料分析。
將大量資料或任務累積後一次性集中執行的計算模式,與即時處理相對。
基準測試是用於評估和比較不同AI模型、演算法或系統性能的標準化方法,提供客觀的性能指標。
AI偏見是指AI系統在訓練或決策過程中,由於資料、演算法或人為因素,產生不公平或歧視性的結果。
大數據指規模龐大、速度快速且多樣化的資料集合,傳統資料處理工具難以有效處理,需要專門的技術與架構來儲存、分析與應用
將類別特徵映射為整數,再將這些整數轉換為其二進位表示的特徵工程方法。
BM25 (Best Matching 25) 是一種用於資訊檢索的排序函數,它基於詞頻和逆文檔頻率,並考慮了文檔長度的影響,以提高檢索的準確性。
位元組對編碼(BPE)是一種資料壓縮技術,也常用於自然語言處理中,作為一種詞彙標記化方法,將單詞分解成更小的子詞單元。