---
title: "點積（Dot Product）"
slug: dot-product
language: zh-TW
source: https://aiterms.tw/terms/dot-product
updated_at: 2026-06-22
tags: [線性代數, 注意力機制, Transformer, 向量運算, 嵌入]
ipas_term: false
---

# 點積（Dot Product）

兩個向量逐元素相乘後加總的純量值，衡量向量間的相似程度與方向一致性。

## 完整說明

點積（Dot Product）又稱內積（Inner Product），是線性代數中最基本的運算之一。給定兩個相同維度的向量 a 與 b，點積定義為對應元素乘積的加總，其幾何意義等於兩向量的模長乘積再乘以夾角的餘弦值。點積廣泛應用於深度學習的注意力機制、相似度計算與矩陣乘法，是理解 Transformer 架構的核心數學基礎。

## 常見問題

### 點積和矩陣乘法是什麼關係？

矩陣乘法是點積的批量化版本。在計算矩陣乘積 C = A × B 時，結果矩陣 C 的每個元素 C[i][j] 等於 A 的第 i 列向量與 B 的第 j 欄向量的點積。因此如果 A 是 m×k 矩陣，B 是 k×n 矩陣，那麼計算 C 需要 m×n 次點積運算，每次點積對 k 個元素做逐元素乘法並加總。深度學習框架中的矩陣乘法算子（如 torch.matmul）正是利用 GPU 的並行計算能力，同時計算所有這些點積，這是深度學習模型能在 GPU 上高效運行的根本原因。

### Transformer 的注意力機制為什麼要對點積除以根號 d_k？

這是為了防止點積值在維度很高時過大，進而導致 softmax 函數進入飽和區。當 Q 和 K 的維度 d_k 很大時，點積的期望方差會隨 d_k 增大而增大，造成某些點積值遠大於其他值，softmax 輸出會趨近於 one-hot 向量（只有最大值接近 1，其他接近 0）。這種極端的 softmax 輸出會導致梯度幾乎為零，模型難以學習。除以 sqrt(d_k) 可以將點積的方差控制在合理範圍，使 softmax 的輸出更加平滑，梯度流動更加順暢，訓練更加穩定。

### 為什麼向量相似度搜尋通常用點積而不是歐氏距離？

兩者各有適用場景，但在文字嵌入等應用中點積（或餘弦相似度）通常更合適。歐氏距離衡量的是兩點在空間中的絕對距離，受向量模長影響很大；如果兩個語義相近的詞語的嵌入向量模長差異很大（例如出現頻率不同導致的訓練效果差異），歐氏距離可能無法正確反映其語義相似性。餘弦相似度只關注向量的方向，不受模長影響。在實際系統中，如果將所有向量預先正規化為單位向量，餘弦相似度與點積等價，且可以利用高度優化的矩陣乘法批量計算，效率遠高於逐對計算歐氏距離。

---

來源：https://aiterms.tw/terms/dot-product
快查頁：https://aiterms.tw/terms/dot-product
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-dot-product