影像描述生成 Image Captioning
影像描述生成(Image Captioning)是電腦視覺與自然語言處理的交叉任務,旨在讓模型自動為輸入影像產生自然語言描述,是多模態 AI 的核心應用之一,評估指標常用 BLEU、CIDEr、SPI
瀏覽 AITerms.tw 中標籤為「自然語言處理」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
影像描述生成(Image Captioning)是電腦視覺與自然語言處理的交叉任務,旨在讓模型自動為輸入影像產生自然語言描述,是多模態 AI 的核心應用之一,評估指標常用 BLEU、CIDEr、SPI
圖像轉文字生成是一種將視覺資訊轉換為自然語言描述的技術,使電腦能夠理解並用文字表達圖片內容。
上下文學習 (In-context Learning) 指的是大型語言模型無需額外訓練,僅通過輸入範例即可學習新任務的能力。
上下文學習理論指大型語言模型無需額外訓練,僅憑藉輸入提示中的範例,即可執行新任務的能力,展現了模型泛化的潛力。
推論是指利用已訓練好的機器學習模型,對新的、未曾見過的資料進行預測或判斷的過程。是模型部署後的核心環節。
從非結構化文本中自動識別和提取特定信息的技術,將非結構化數據轉為結構化知識。
信息檢索是一個計算機科學領域,旨在從大規模的資料集合中精準查找符合用戶需求的相關信息。它是搜索引擎、推薦系統和知識管理的核心技術。
長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。
指令微調是一種利用特定格式指令資料集,微調預訓練語言模型,使其更精確理解並執行人類指令的技術。
意圖分類是自然語言處理中的一項任務,旨在將一段文字(例如使用者查詢)分類到預定義的意圖類別中,以理解使用者的目的。
自動分析自然語言輸入,識別用戶的主要意圖或目標,用於驅動對話系統或任務執行。
標註者一致性衡量多位標註者在相同資料上標註結果的相似程度。高一致性代表標註品質良好,反之則可能需要重新評估標註規範。
在特定子任務上直接評估模型或表示的質量,如詞向量的類比任務,不涉及下游應用。
逆向文件頻率(IDF)是一種評估詞彙重要性的統計指標,用於降低常見詞彙權重並突顯罕見關鍵字。
迭代反向翻譯是一種自然語言處理技術,透過將目標語言翻譯回來源語言生成合成平行語料,並反覆交替訓練正反向模型以提升翻譯品質。