AI治理 AI Governance
AI治理是指建立一套框架和流程,以確保AI系統的開發和使用符合倫理、法律和社會價值觀。
瀏覽 AITerms.tw 中標籤為「資料處理」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
資料擴增術是一種增加訓練資料多樣性的技術,透過對現有資料進行微小的修改,創造出新的、但仍然代表相同類別的資料點,以提升模型泛化能力。
描述資料集來源、組成、預期用途、限制與潛在偏誤的文件。
資料並行是一種分散式訓練方法,將資料分割成多份,分配給多個節點,每個節點使用相同模型副本訓練不同資料子集。
將大規模資料集水平切割為多個獨立區塊,以提升平行處理效率與降低記憶體負荷。
資料倉儲是針對查詢與分析優化的結構化資料儲存系統,整合多來源資料以支援商業智慧決策
密度型空間分群演算法(Density-Based Spatial Clustering of Applications with Noise, DBSCAN)是一種基於資料點鄰域密度進行分群的演算法,
指感測器或裝置隨時間產生資料分佈變化的現象,影響模型效能。
降維處理旨在減少資料集的特徵數量,同時保留重要資訊,以簡化模型、加速運算並避免維度災難。
直接侵權指未經授權而直接複製、散布或使用受版權保護作品的行為,在AI領域涉及模型訓練與輸出。
AI藥物發現利用人工智慧加速藥物研發流程,從靶點識別、候選藥物篩選、臨床試驗設計到藥物重定位,降低成本並縮短開發週期。
熵是資訊理論中衡量隨機變數不確定性的指標,數值越高代表不確定性越大。在機器學習中,熵常用於特徵選擇和決策樹構建。
期望最大化 (EM) 算法是一種迭代算法,用於在存在隱變量的情況下,估計機率模型的參數。它交替執行期望 (E) 步驟和最大化 (M) 步驟。
在機器學習建模前,透過視覺化與統計方法理解資料特徵、發現模式並檢驗假設的關鍵資料處理步驟。
指數平滑法是一系列時序預測方法,使用加權平均數,其中權重隨著時間的推移呈指數衰減,更重視近期觀測值。
萃取、轉換、載入(ETL)是資料工程的核心流程,指從多個來源提取數據,經過清洗與格式轉換,最終載入至目標資料倉儲的過程
提取式摘要技術從原文中選擇重要句子組成摘要,簡單直接,易於實現,但可能缺乏連貫性,且無法進行語義概括。
詞性標注是自然語言處理中,為句子中的每個詞彙指定詞性的過程,例如名詞、動詞、形容詞等,是後續語法分析的基礎。
事後插補是在模型訓練完成後,於推論階段或生成事後解釋時,即時填補缺失特徵的技術。
預測分析(Predictive Analytics)運用機器學習與統計模型,從歷史資料預測未來趨勢或事件機率,廣泛用於銷售預測、風險管理、客戶流失預防。
程式化標註是一種利用程式碼(例如,規則、啟發式方法或外部知識庫)自動生成訓練資料標籤的技術,以加速模型開發。
透過自動化演算法從多語言文本中萃取或合成的高語義相似度句子對集合,主要用於緩解跨語言任務中的資料稀缺問題。
推薦系統是一種利用演算法預測使用者對物品偏好的資訊過濾系統,旨在幫助使用者發現感興趣的內容,並提升平台互動與銷售。
遙感技術是從遠處獲取地球表面資訊的科學與藝術,不直接接觸目標。
RPA(機器人流程自動化)用軟體機器人模擬人類操作電腦,自動執行重複性業務流程,廣泛應用於金融對帳、訂單處理、HR 入職等高量重複性作業。
穩健性是指模型在面對輸入數據的微小擾動、對抗性攻擊或分布偏移時,仍能維持其性能表現的能力。
處理合成孔徑雷達影像,提取地物資訊,應用於環境監測、災害評估等領域。
情感分析是一種自然語言處理技術,用於識別和提取文本中的主觀情感,例如正面、負面或中性情緒,應用於輿情監控、客戶回饋分析等。
SPARQL是一種用於查詢和操作RDF資料的查詢語言,類似於SQL用於關係資料庫。它允許使用者從知識圖譜中提取特定資訊。
語者分段旨在識別音訊中不同語者的發言時間段,並將其區分開來,無需事先知道語者身份。
衡量資料集各數值與平均值之間平均離散程度的統計指標,反映資料的變異性。
詞幹提取是自然語言處理中將單詞簡化為其詞幹或詞根形式的過程,通常通過刪除後綴來實現。
次詞單元化是將單詞拆分為更小的子單元(次詞)的技術,用於解決詞彙量過大和未登錄詞(OOV)問題,提升模型泛化能力。