行動識別 Action Recognition
從視頻中識別和分類人體或物體執行的動作,將視頻片段分配給預定義的動作類別。
瀏覽 AITerms.tw 中標籤為「電腦視覺」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
從視頻中識別和分類人體或物體執行的動作,將視頻片段分配給預定義的動作類別。
啟動圖是卷積神經網路中,輸入資料經過卷積與啟動函數處理後所輸出的多維度特徵矩陣。
注意力圖是注意力機制的內部權重視覺化表示,呈現模型在處理序列資料時,各個元素之間的相互關注程度與依賴關係。
自動駕駛技術利用感測器、人工智慧和控制系統,使車輛能夠在沒有人為干預的情況下感知環境並自主導航。
CLIP (Contrastive Language-Image Pre-training) 是一種透過對比學習,將圖像與文字描述連結的模型,能進行零樣本圖像分類,無需針對特定任務重新訓練。
內容生成是指使用人工智慧技術自動創建文字、圖像、音訊或影片等內容的過程,旨在降低內容創作成本並提高效率。
卷積運算是提取特徵的數學操作,透過濾波器在資料上滑動捕捉邊緣與紋理,廣泛應用於電腦視覺領域。
餘弦相似度是一種衡量兩個非零向量之間夾角餘弦值的度量方法,常用於評估文本或資料點之間的相似程度。
資料標註是指為原始資料添加標籤的過程,這些標籤提供關於資料的額外資訊,用於訓練監督式機器學習模型。
密集圖像描述是一項結合電腦視覺與自然語言處理的技術,旨在偵測影像中的多個感興趣區域,並為每個區域生成對應的文字描述。
擴散模型是一種生成模型,透過逐步將雜訊還原成清晰圖像,達成從隨機雜訊生成資料的目的
將空間注意力機制中不同維度或語義因素的表示分離,使模型能獨立控制空間定位與內容特徵的技術。
將掃描或數位文檔轉換為結構化信息的技術,理解文檔內容、版面和邏輯關係。
邊緣人工智慧是指在靠近資料來源的邊緣設備上執行AI運算,而非在雲端伺服器上。可降低延遲、節省頻寬、保護隱私。
特徵向量是指在線性變換下,方向保持不變或僅反向的非零向量。它對應於特定的特徵值,代表變換的主要作用方向。
具身人工智慧是指讓AI系統擁有物理軀體,透過與環境互動來學習和解決問題,強調感知、行動和環境之間的循環。
編碼器將輸入資料轉換為固定長度的向量表示,提取其語義特徵,以供解碼器或下游任務使用。
標籤雜訊是指訓練資料集中不正確或錯誤的標籤。這些錯誤標籤會降低模型效能,導致模型學習到錯誤的模式。
土地覆蓋分類是將遙感影像像素歸類為不同地物類型的過程。
潛在擴散模型(LDM)是一種生成式AI模型,透過在潛在空間中進行擴散和逆擴散過程,生成高解析度、高品質的圖像或其他資料。
光達資料處理是指對雷射雷達感測器採集的三維點雲資料進行清理、分析與解釋的過程,旨在從中提取有意義的空間資訊,廣泛應用於自動駕駛、測繪與環境監測等領域。
利用深度學習技術改善在弱光或夜間條件下拍攝的影像品質,提升亮度、降低雜訊並恢復細節。
醫療影像分析利用AI技術,自動或半自動地分析醫學影像,輔助醫生進行疾病診斷、病情監測和治療規劃,提高診斷效率和準確性。
從視頻序列中估計場景或相機的運動,包括物體運動、相機運動(ego-motion)及場景流等。
自駕車運動規劃是為自動駕駛車輛計算安全、可行且最佳行駛路徑的技術,確保車輛能避開障礙物並達成駕駛目標。
一種在連續影像中偵測並識別多個移動物件,持續賦予穩定追蹤編號與軌跡預測的電腦視覺分析技術。
將圖像轉換為結構化圖形的電腦視覺技術。節點代表物件,邊緣表示物件間的關係,賦予機器深度的場景理解力。
Meta提出的大規模基礎模型,能對任意圖像進行實例分割,採用提示工程實現靈活的互動式分割。
衡量圖像分割任務中預測區域與真實區域重疊程度的指標。
感測器融合是整合多個異質感測器資料的技術,旨在消除單一硬體盲區,提供更精確且可靠的環境感知能力。
連體神經網路是一種包含兩個或多個共享相同權重的相同神經網路的架構,用於比較輸入之間的相似性或關係。
超解析度重建是一種電腦視覺技術,旨在從低解析度影像重建出高解析度影像,提升影像的清晰度和細節。
Swin Transformer是一種層級式的Transformer模型,用於電腦視覺任務,透過移動視窗機制有效降低計算複雜度,並提升模型效能。