馬可夫決策過程 Markov Decision Process
馬可夫決策過程(MDP)是一種用於建模決策的數學框架,其中結果部分隨機,部分受決策者控制。它廣泛應用於強化學習。
瀏覽 AITerms.tw 中標籤為「最佳化」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
馬可夫決策過程(MDP)是一種用於建模決策的數學框架,其中結果部分隨機,部分受決策者控制。它廣泛應用於強化學習。
矩陣分解推薦是一種推薦系統技術,它將用戶-項目互動矩陣分解為兩個低維矩陣,分別代表用戶和項目的隱含特徵,用於預測用戶對未互動項目的偏好。
最大似然估計 (MLE) 是一種統計方法,用於估計機率分佈的參數,它通過最大化觀察到樣本數據的似然函數來實現。
一種衡量兩個機率分佈之間差異的統計距離,常用於生成模型評估與領域適應。
元學習,又稱學習如何學習,旨在訓練模型能夠快速適應新任務或環境,透過少量樣本即可達到良好的效能。
混合精度訓練是一種使用不同精度(如 FP16 和 FP32)的浮點數進行模型訓練的技術,旨在加速訓練過程並減少記憶體佔用。
混合正則化是一種透過組合兩個或多個訓練樣本及其標籤來生成新訓練數據的技術,藉此擴增資料集多樣性,有效減輕神經網路模型的過擬合現象並提升泛化能力。
專家混合模型是一種機器學習技術,透過結合多個獨立的「專家」模型,針對不同輸入選擇性地激活特定專家,以提升模型整體效能。
模型快取是一種將已訓練的模型儲存在記憶體或快速儲存裝置中,以加速模型載入和推論的技術。
模型壓縮是指減少機器學習模型大小和計算複雜度的技術,以便在資源有限的設備上部署,同時保持模型性能。
邊緣端模型壓縮是縮減神經網路體積與運算量的技術,使人工智慧模型能在資源受限的邊緣裝置上順暢執行。
模型平行化是一種將大型模型分割到多個裝置上進行訓練或推論的技術,以克服單一裝置的記憶體限制。
學習環境模型(動態和獎賞),用模型進行規劃而非直接與環境互動的強化學習方法。
蒙地卡羅方法是一種利用隨機抽樣來估算數學問題解的計算技術。它通過大量模擬隨機事件,統計結果,從而得到近似解。
運動規劃是計算機科學和機器人學中的一個領域,旨在為機器人或其他代理找到從起點到終點的可行路徑,同時避開障礙物並滿足特定約束。
自駕車運動規劃是為自動駕駛車輛計算安全、可行且最佳行駛路徑的技術,確保車輛能避開障礙物並達成駕駛目標。
多代理系統是由多個獨立自主的代理(Agent)組成的計算機系統,這些代理透過相互溝通、協調與合作,共同解決複雜問題或達成特定目標。
多任務學習是一種機器學習方法,旨在同時訓練一個模型來執行多個相關任務,以提升模型的泛化能力和效率。