AI 主題集合

資料處理 術語大全

完整收錄 209 個 資料處理 相關 AI 術語,每個術語提供中英文定義、深度解說與 iPAS 考試重點分析。

SPARQL查詢(SPARQL)

SPARQL是一種用於查詢和操作RDF資料的查詢語言,類似於SQL用於關係資料庫。它允許使用者從知識圖譜中提取特定資訊。

查看術語

資料擴增術(Data Augmentation)

資料擴增術是一種增加訓練資料多樣性的技術,透過對現有資料進行微小的修改,創造出新的、但仍然代表相同類別的資料點,以提升模型泛化能力。

查看術語

四分位距(IQR)

四分位距(Interquartile Range, IQR)是第三四分位數(Q3)與第一四分位數(Q1)的差值,代表資料中間 50% 的分布範圍,常用於穩健的異常值偵測,不受極端值影響。

查看術語

熵(Entropy)

熵是資訊理論中衡量隨機變數不確定性的指標,數值越高代表不確定性越大。在機器學習中,熵常用於特徵選擇和決策樹構建。

查看術語

巢狀欄位(Nested Field)

巢狀欄位是一種資料結構,指一個欄位內部包含其他子欄位,形成階層關係,常用於表示複雜或半結構化資料,提升資料組織與查詢效率。

查看術語

BM25算法(BM25)

BM25 (Best Matching 25) 是一種用於資訊檢索的排序函數,它基於詞頻和逆文檔頻率,並考慮了文檔長度的影響,以提高檢索的準確性。

查看術語

演算法(Algorithm)

演算法是一組定義明確的指令,用於解決特定問題或執行特定任務。它接收輸入,經過一系列步驟處理,並產生輸出。

查看術語

物聯網(IoT)

物聯網是將實體裝置透過網際網路相互連接,使其能收集並傳輸資料的技術架構,為智慧化應用提供資料基礎。

查看術語

共變異數(Covariance)

共變異數衡量兩個變數如何一起變化。正值表示它們趨於一起增加或減少,負值表示一個增加時另一個趨於減少,零值表示沒有線性關係。

查看術語

語料庫(Corpus)

語料庫是大量結構化的文本集合,用於語言研究和自然語言處理,提供真實語言使用的範例,用於訓練和評估模型。

查看術語

資料湖(Data Lake)

資料湖是一種大型集中式儲存庫,能以原始格式存放結構化、半結構化和非結構化的各式資料,提供高度彈性與可擴展性。

查看術語

合成數據(Synthetic Data)

合成數據是指通過程式或演算法生成的人工數據,而非從真實世界收集的數據。它常用於訓練AI模型,特別是在真實數據稀缺或涉及隱私問題時。

查看術語

混合正則化(Mixing Regularization)

混合正則化是一種透過組合兩個或多個訓練樣本及其標籤來生成新訓練數據的技術,藉此擴增資料集多樣性,有效減輕神經網路模型的過擬合現象並提升泛化能力。

查看術語

標籤偏誤(Label Bias)

標籤偏誤是指訓練資料的標註結果反映了人類主觀判斷或社會既有成見,導致資料標籤帶有系統性偏差,使AI模型學習到不公平的關聯。

查看術語

分層抽樣(Stratified Sampling)

分層抽樣是一種統計抽樣方法,將母體依據特定特徵劃分為互斥的子群體(層),再從各層中獨立抽樣。這確保了各層在樣本中的代表性,能有效降低抽樣誤差,特別適用於處理不平衡資料集。

查看術語

ACID原則(ACID)

確保資料庫交易可靠執行的四個基本屬性:原子性、一致性、隔離性與持久性,是資料處理的重要基礎。

查看術語

光達資料處理(LiDAR Processing)

光達資料處理是指對雷射雷達感測器採集的三維點雲資料進行清理、分析與解釋的過程,旨在從中提取有意義的空間資訊,廣泛應用於自動駕駛、測繪與環境監測等領域。

查看術語

相關係數(Correlation)

相關係數衡量兩個變數之間線性關係的強度和方向,範圍從 -1 到 1。1 表示完全正相關,-1 表示完全負相關,0 表示沒有線性關係。

查看術語

高基數特徵(High Cardinality)

高基數特徵(High Cardinality)指某個類別型特徵包含大量不同取值的情況,例如用戶 ID、商品 SKU、地理位置等可能有數萬至數百萬種取值,直接進行 One-Hot 編碼會導致維度爆炸,需

查看術語

數位分身(Digital Twin)

數位分身是真實世界實體或系統的虛擬化身,通過收集數據進行模擬、監控和預測,以優化性能、預防故障和做出更明智的決策。

查看術語

資料投毒攻擊(Data Poisoning)

資料投毒攻擊是一種惡意攻擊,攻擊者將惡意或錯誤的資料注入到訓練資料集中,以影響機器學習模型的性能或行為。攻擊目標是使模型產生錯誤的預測或執行其他有害操作。

查看術語

資料洩漏(Data Leakage)

資料洩漏(Data Leakage)是指模型訓練過程中,未來或測試集的資訊意外滲入訓練集,導致模型在評估時表現虛高,但部署後實際效能大幅下滑的現象。

查看術語

光學字元辨識(OCR)

光學字元辨識(OCR)是一種技術,能將圖像中的文字轉換為機器可讀的文字格式,例如將掃描文件轉換為可編輯的文字。

查看術語

詐欺偵測(Fraud Detection)

AI 詐欺偵測(Fraud Detection)透過機器學習即時分析交易行為,識別異常模式,廣泛應用於銀行信用卡詐欺防範、網路詐騙偵測與保險理賠審核。

查看術語

隨機過採樣(Random Oversampling)

隨機過採樣(Random Oversampling)是處理類別不平衡問題的技術,透過隨機複製少數類別的現有樣本,使各類別的訓練樣本數趨於平衡,讓模型對少數類別有足夠的學習機會,但有增加過擬合風險的疑慮

查看術語

分詞(Tokenization)

分詞是自然語言處理(NLP)中的基礎步驟,旨在將連續的文本序列拆解成更小的、具有語義意義的單元,例如詞彙、子詞或字符,這些單元稱為 tokens。

查看術語

圖像識別(Image Recognition)

圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。

查看術語

先知預測模型(Prophet)

Prophet是由Facebook開發的時間序列預測模型,專為具有強烈季節性趨勢的商業時間序列資料設計,易於使用且具有良好的預測能力。

查看術語

泛化能力(Generalization)

泛化能力是指機器學習模型在未見過的數據上表現良好的能力。一個具有良好泛化能力的模型能夠從訓練數據中學習到普遍規律,並應用於新數據。

查看術語

變異數分析(ANOVA)

變異數分析 (ANOVA) 是一種統計方法,用於比較兩個或多個群體的平均數是否存在顯著差異。它將總變異分解為不同來源的變異。

查看術語

人工智慧監管(AI Regulation)

人工智慧監管是指政府或相關機構制定和實施的,旨在規範人工智慧技術開發、部署和使用的法律、政策和指導方針,以確保其安全、公平和符合倫理。

查看術語

圖池化(Graph Pooling)

圖池化是一種減少圖形結構資料維度與節點數量的技術,用以提取全域特徵,降低計算成本,在圖神經網路中扮演關鍵的降維角色。

查看術語

大數據(Big Data)

大數據指規模龐大、速度快速且多樣化的資料集合,傳統資料處理工具難以有效處理,需要專門的技術與架構來儲存、分析與應用

查看術語

冷啟動問題(Cold Start Problem)

冷啟動問題是指在推薦系統中,對於新使用者或新物品,由於缺乏足夠的互動資料,導致無法準確推薦的問題。常見解決方案包括利用元資料、內容過濾或混合推薦。

查看術語

常見問題

資料處理 是什麼?

本頁依已發布術語的主題標記,整理 209 個 資料處理 相關概念。

資料處理 有哪些核心術語?

裝置漂移、SPARQL查詢、推薦系統、指數平滑法、資料卡

資料處理 相關術語在 iPAS 考試中重要嗎?

本頁有 38 個術語標記為 iPAS 相關。