數位影像處理 Image
AI 模型對數位圖片進行處理、分析或生成的基礎技術,涵蓋像素級的特徵萃取、語意解析與跨模態影像合成。
查詢 Transformer、RAG、AI Agent 等 AI 術語,包含定義、iPAS 考點分析、常見問題與 Markdown 版本。
AI 模型對數位圖片進行處理、分析或生成的基礎技術,涵蓋像素級的特徵萃取、語意解析與跨模態影像合成。
影像描述生成(Image Captioning)是電腦視覺與自然語言處理的交叉任務,旨在讓模型自動為輸入影像產生自然語言描述,是多模態 AI 的核心應用之一,評估指標常用 BLEU、CIDEr、SPI
圖像分類是電腦視覺中的一項任務,旨在將圖像分配到預定義的類別中。模型學習圖像特徵,並基於這些特徵預測圖像所屬的類別。
圖像生成是一種人工智慧技術,旨在從文字描述、其他圖像或隨機雜訊中創造出全新的、逼真的或風格化的圖像。
利用周邊像素信息自動填充或重建影像中的遺失、損壞或標記區域,用於去除物體、修復老照片等。
圖像識別是電腦視覺領域的一項任務,旨在識別圖像中的對象、人物、地點或事件。它比圖像分類更廣泛,可能涉及定位和標記圖像中的多個對象。
影像分割是一種電腦視覺技術,將影像劃分為多個區域或物件,以便分析或理解影像內容,常用於醫學影像分析、自動駕駛等。
從低解析度影像重建高解析度版本,增加像素數或恢復細節,廣泛應用於監視、醫療影像、老照片增強。
在多模態學習中,將圖像和文本的表示映射到共同的語義空間,使得語義相關的圖文對的表示相近。
圖像轉文字生成是一種將視覺資訊轉換為自然語言描述的技術,使電腦能夠理解並用文字表達圖片內容。
透過學習專家演示直接訓練智能體策略的監督學習方法。
機器人模仿學習是一種讓機器人透過觀察人類或其他專家示範來學習技能的方法,旨在使機器人能執行複雜任務。
使用者在與推薦系統互動時被動產生的行為信號(如點擊、購買、停留時間),相對於明確評分等顯式回饋,隱式回饋資料量更大但含義更模糊。
上下文學習 (In-context Learning) 指的是大型語言模型無需額外訓練,僅通過輸入範例即可學習新任務的能力。
上下文學習理論指大型語言模型無需額外訓練,僅憑藉輸入提示中的範例,即可執行新任務的能力,展現了模型泛化的潛力。
使用多分支並行卷積的架構,在同一層中採用不同大小(1×1, 3×3, 5×5)的卷積核進行特徵提取,捕捉多尺度信息。
Inception Network 是一種深度卷積神經網路架構,旨在透過並行使用多種卷積核大小,捕捉不同尺度的特徵,提升模型效能。
推論是指利用已訓練好的機器學習模型,對新的、未曾見過的資料進行預測或判斷的過程。是模型部署後的核心環節。
推論最佳化旨在提升已訓練模型的推論速度、降低資源消耗,使其更有效率地部署於實際應用中。
透過對比正負樣本,最大化互資訊下界的損失函數,主要用於自監督表徵學習。
從非結構化文本中自動識別和提取特定信息的技術,將非結構化數據轉為結構化知識。
信息檢索是一個計算機科學領域,旨在從大規模的資料集合中精準查找符合用戶需求的相關信息。它是搜索引擎、推薦系統和知識管理的核心技術。
資訊理論研究資訊的量化、儲存與傳輸,核心概念包含熵、互資訊、通道容量等,為資料壓縮、通訊編碼等領域奠定基礎。
內積是計算兩向量相似度與投影關係的數學運算。在機器學習中用於衡量特徵相關性,為神經網路的核心基礎。
長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。
在影像中同時偵測物件並為每個獨立個體生成精確像素級遮罩,區分同類中的不同個體。
指令微調是一種利用特定格式指令資料集,微調預訓練語言模型,使其更精確理解並執行人類指令的技術。
探索不足是指代理人過早專注於已知的高回報行為,未充分嘗試其他未知行為,導致陷入局部最佳解的現象。
整合地獄是指在系統開發與機器學習專案中,將各自獨立開發的模組或模型進行合併時,因依賴衝突而引發的嚴重錯誤與發布延遲。
意圖分類是自然語言處理中的一項任務,旨在將一段文字(例如使用者查詢)分類到預定義的意圖類別中,以理解使用者的目的。
自動分析自然語言輸入,識別用戶的主要意圖或目標,用於驅動對話系統或任務執行。
標註者一致性衡量多位標註者在相同資料上標註結果的相似程度。高一致性代表標註品質良好,反之則可能需要重新評估標註規範。
結合異常偵測與可解釋AI技術,不僅識別異常點,還能說明異常發生的原因,提升決策透明度。
設計和使用易於人類理解決策過程的機器學習模型,透過明確的特徵-預測映射提高透明性與信任度。
交並比是物件偵測中,用來評估預測框與真實框定位準確度的指標,計算兩者重疊面積與聯集面積的比率
在特定子任務上直接評估模型或表示的質量,如詞向量的類比任務,不涉及下游應用。
入侵偵測系統(IDS)是一種安全系統,旨在監控網路或系統中的惡意活動或策略違規行為。它通過分析流量、日誌和系統行為來識別潛在的入侵。
逆向設計是一種從目標性能出發,利用機器學習或最佳化演算法推導出滿足該性能之材料結構或系統參數的方法。
逆向文件頻率(IDF)是一種評估詞彙重要性的統計指標,用於降低常見詞彙權重並突顯罕見關鍵字。
逆向運動學是計算機器人或骨骼動畫等系統中,為了達到特定末端效應器位置和姿態,各關節需要旋轉的角度。
從專家演示的行為推斷潛在獎勵函數的強化學習方法。
物聯網是將實體裝置透過網際網路相互連接,使其能收集並傳輸資料的技術架構,為智慧化應用提供資料基礎。
衡量兩個邊界框或區域重疊程度的指標,值域 0 到 1,常用於物件偵測與影像分割的評估。
四分位距(Interquartile Range, IQR)是第三四分位數(Q3)與第一四分位數(Q1)的差值,代表資料中間 50% 的分布範圍,常用於穩健的異常值偵測,不受極端值影響。
孤立森林是一種無監督異常偵測演算法,透過隨機切割資料空間,將數量稀少且特徵獨特的資料點快速分離出來。
迭代反向翻譯是一種自然語言處理技術,透過將目標語言翻譯回來源語言生成合成平行語料,並反覆交替訓練正反向模型以提升翻譯品質。