聲學建模 Acoustic Modeling
在語音識別、語音合成等任務中,建立音訊特徵與語言單位(音素、詞彙)對應關係的機器學習模型。
瀏覽 AITerms.tw 中標籤為「深度學習」的 AI 術語,快速找到定義、FAQ 與 iPAS 考試重點。
批次正規化是一種標準化技巧,針對每層網路的輸入進行調整,使訓練過程更穩定,並允許使用較大的學習率
集束搜尋是一種啟發式搜尋演算法,用於序列預測任務,它在每個時間步保留多個最有可能的候選序列(集束),而非僅僅選擇最佳選項。
黑箱模型是指其內部運作機制對使用者而言不透明的模型,難以理解輸入與輸出之間的具體關係。
邊界框偵測是一種電腦視覺技術,用於在影像或影片中定位和識別物體,並使用矩形框標示出物體的位置。
影像分割是一種電腦視覺技術,將影像劃分為多個區域或物件,以便分析或理解影像內容,常用於醫學影像分析、自動駕駛等。
使用多分支並行卷積的架構,在同一層中採用不同大小(1×1, 3×3, 5×5)的卷積核進行特徵提取,捕捉多尺度信息。
推論是指利用已訓練好的機器學習模型,對新的、未曾見過的資料進行預測或判斷的過程。是模型部署後的核心環節。
長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。
利用AI技術在衛星影像中識別並定位特定物件,如建築、車輛、船隻等。
光學字元辨識(OCR)是一種技術,能將圖像中的文字轉換為機器可讀的文字格式,例如將掃描文件轉換為可編輯的文字。
ONNX 是一種開放標準,用於表示機器學習模型,允許模型在不同框架之間互操作,簡化模型部署流程。
分類任務中測試集包含訓練集未見過的類別,模型需識別『這是一個未知類別』的問題。
自動識別並分割影像中最吸引人類視覺注意的區域,常應用於影像縮略圖生成與視覺注意力研究。
AI驅動科學發現指利用人工智慧技術加速科學研究流程,涵蓋假設生成、實驗設計、資料分析與結果驗證,大幅提升各學科創新效率與發現速度。
語音合成技術是一種將文字轉換成人類語音的技術,也稱為文字轉語音(TTS)。它廣泛應用於語音助理、導航系統和輔助科技等領域。
競價型訓練利用閒置的雲端運算資源,以大幅降低模型訓練成本,但可能因資源回收而中斷。
利用立體影像對(左右視圖)的對應像素差異估計深度信息,是三維重建的基礎。
風格轉換是一種使用人工智慧技術,將一張圖片的風格應用到另一張圖片的內容上的方法,創造出具有新風格的圖像。