對齊稅 Alignment Tax
模型在對齊(使其行為符合人類價值觀)過程中可能損失的性能,特別是在某些原始能力上的下降。
查詢 Transformer、RAG、AI Agent 等 AI 術語,包含定義、iPAS 考點分析、常見問題與 Markdown 版本。
計算機視覺領域的自監督學習方法,隨機遮蔽輸入影像的部分區域,訓練模型從可見像素重建被遮蔽區域,類似於視覺版的遮蔽語言模型。
矩陣分解是一種將矩陣分解為兩個或多個矩陣乘積的技術,常應用於推薦系統,以預測用戶對未評分項目的偏好。
混合精度訓練是一種使用不同精度(如 FP16 和 FP32)的浮點數進行模型訓練的技術,旨在加速訓練過程並減少記憶體佔用。
概述AI模型性能、限制、預期用途、評估指標與潛在風險的文件。
多步預測是一種時間序列分析技術,旨在同時或依序預測未來多個時間點的數值,而非僅單一未來點。
一種整合實例分割與語義分割的神經網路架構,透過特徵金字塔網路同時處理前景物件與背景環境的高效模型。
模型參數是機器學習模型在訓練過程中學習到的數值,用於決定模型如何對輸入資料進行轉換和預測。它們是模型的內部變數。
確定人體或物體在三維空間中的位置和方向,通常輸出關鍵點(如關節位置)的坐標。
事後插補是在模型訓練完成後,於推論階段或生成事後解釋時,即時填補缺失特徵的技術。
在模型訓練完成後應用的量化技術,通過將浮點參數轉換為低精度整數或定點數來減少模型大小和計算成本,實現過程簡單但精度損失相對較大。
精確率是模型預測為正例中真正為正例的比例,反映預測結果的準確度,與召回率形成取捨
遙感技術是從遠處獲取地球表面資訊的科學與藝術,不直接接觸目標。
獎勵函數是強化學習中定義代理在特定狀態下採取特定動作後獲得的獎勵的函數,用於引導代理學習期望行為。
人類回饋強化學習(RLHF)是一種利用人類回饋訊號,訓練強化學習模型,使其行為更符合人類偏好的方法。
使用梯度平方的指數加權移動平均調整學習率的最佳化演算法,改進了 AdaGrad 學習率單調遞減的問題。
穩健性是指模型在面對輸入數據的微小擾動、對抗性攻擊或分布偏移時,仍能維持其性能表現的能力。
處理合成孔徑雷達影像,提取地物資訊,應用於環境監測、災害評估等領域。
將非結構化文本與結構化數據庫或本體進行對齊,實現兩者的語義關聯。
槽位填充是自然語言理解中的一項任務,旨在從文本中提取特定資訊,並將其填入預定義的槽位中,以形成結構化資料。
狀態機模型是一種計算模型,系統在任何給定時間都處於有限數量的狀態之一,並根據輸入在狀態之間轉換。