摘要生成技術 Abstractive Summarization
摘要生成技術利用AI理解原文,並以新的句子和詞彙生成摘要,更接近人類的摘要方式,但實現難度較高。
查詢 Transformer、RAG、AI Agent 等 AI 術語,包含定義、iPAS 考點分析、常見問題與 Markdown 版本。
摘要生成技術利用AI理解原文,並以新的句子和詞彙生成摘要,更接近人類的摘要方式,但實現難度較高。
透過微小擾動特意設計的輸入,能使經過訓練的 AI 模型產生錯誤預測的輸入樣本
演算法是一組定義明確的指令,用於解決特定問題或執行特定任務。它接收輸入,經過一系列步驟處理,並產生輸出。
在語言模型生成過程中整合外部知識來源或工具,以提升生成內容的準確性、時效性與可信度的技術框架。
一種極致的參數高效微調方法,只訓練模型中偏置項(Bias)的某些位,相比全模型微調減少99.9%的訓練參數,成本極低但性能接近全參數微調。
BM25 (Best Matching 25) 是一種用於資訊檢索的排序函數,它基於詞頻和逆文檔頻率,並考慮了文檔長度的影響,以提高檢索的準確性。
Boosting 是一種集成學習技術,透過迭代訓練一系列弱學習器,每個學習器都試圖糾正前一個學習器的錯誤,最終將它們組合起來形成一個強學習器。
DBSCAN 聚類中位於核心點鄰域內、但自身鄰域密度不足的邊緣資料點。
因果推論是從觀察數據中推斷因果關係的方法,旨在確定一個變數的變化是否直接導致另一個變數的變化。
金吉拉縮放是一種模型縮放法則,旨在透過調整模型大小和訓練資料量,以達到最佳的計算效率,避免過度訓練或訓練不足。
引文網路是將文獻作為節點、引用關係作為有向邊的圖結構,用於分析學術影響力與知識傳承脈絡。
協同過濾是一種推薦系統技術,透過分析使用者行為或偏好,預測使用者可能感興趣的項目,例如商品、電影或音樂。
內容生成是指使用人工智慧技術自動創建文字、圖像、音訊或影片等內容的過程,旨在降低內容創作成本並提高效率。
持續整合設計是規劃自動化流程,頻繁整合程式碼、建構與測試,旨在提升軟體開發效率與品質。
餘弦相似度是一種衡量兩個非零向量之間夾角餘弦值的度量方法,常用於評估文本或資料點之間的相似程度。
描述多個隨機變數兩兩之間線性相關程度與各自變異數的對稱方陣。
一種自監督預訓練任務,隨機遮蔽輸入序列中的部分 token,讓模型依據上下文預測被遮蔽的原始詞,是 BERT 系列模型的核心訓練目標。
最大似然估計 (MLE) 是一種統計方法,用於估計機率分佈的參數,它通過最大化觀察到樣本數據的似然函數來實現。
在神經網路基礎上增加外部記憶模組,透過可學習的讀寫機制實現長期資訊儲存和檢索。
衡量圖像分割任務中預測區域與真實區域重疊程度的指標。
使用編碼器-解碼器架構將一個序列轉換為另一個序列,廣泛應用於翻譯、文本摘要等。
基於會話推薦利用使用者單次瀏覽會話內的行為序列,預測使用者下一步可能感興趣的項目,無需使用者歷史資料。
影子部署是一種零風險的部署方式,新版本與舊版本同時運行,使用者只看到舊版本的結果,新版本的預測結果被記錄但不返回,用於離線評估新版本的實際性能。
模擬加速是一種結合人工智慧與計算科學的技術,用於在保持合理精確度的前提下,大幅縮短複雜系統模擬所需的時間。
超解析度重建是一種電腦視覺技術,旨在從低解析度影像重建出高解析度影像,提升影像的清晰度和細節。
系統提示詞是用於引導大型語言模型行為的初始指令,影響模型的回應風格、知識範圍和任務執行方式。
將單個張量(矩陣或更高維數組)的計算分割到多個 GPU 設備上,通過跨設備並行計算矩陣乘法等操作的分佈式訓練方法。
測試資料集用於評估模型在未見過資料上的泛化能力,是模型效能的最終指標,在模型部署前使用。
文字生成音訊(Text-to-Audio)是把一段文字描述直接轉成聲音的生成式 AI 技術,產出的是音樂、音效或環境音,不是唸稿的人聲。它跟文字轉語音(Text-to-Speech)最大的差別,在於生成的是整個聲音場景,還是單純的說話聲。
文本蘊含是判斷一段前提文本是否能邏輯推導出另一段假設文本的自然語言處理任務,廣泛應用於問答系統與事實查核。