---
title: "語音合成技術（Speech Synthesis）"
slug: speech-synthesis
language: zh-TW
source: https://aiterms.tw/terms/speech-synthesis
updated_at: 2026-07-29
tags: [語音辨識, 機器學習, 深度學習, AI應用, 模型訓練, 神經網路]
ipas_term: false
---

# 語音合成技術（Speech Synthesis）

> **你有沒有按下朗讀按鈕，想知道電腦怎麼把文字念得像人一樣？**
>
> 你可以把它想成把文字變成聲音的技術，像導航、旁白、電子書朗讀都靠它。
>
> 它的重要性在於，很多場景不是要你看字，而是要讓資訊直接「說」出來，方便你邊走邊聽、邊做事邊接收內容。
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆

> **語音合成 vs 語音辨識**
>
> 語音合成：把文字變成聲音，讓機器會說話。
>
> 語音辨識：把聲音變成文字，讓機器聽懂人說了什麼。
>
> 最關鍵的區別：一個是輸出聲音，一個是輸入聲音。

### 記住這句就好

> 看文字要變成自然聲音，就想到語音合成。

### 實際案例

> 你在圖書館用手機開啟朗讀功能，長文章就能直接聽，不必一直盯著螢幕。
>
> 導航 App 在你開車時播報前方轉彎，這也是語音合成在工作。

### 算法與應用

> 它通常會先把文字轉成音素、韻律和停頓資訊，再由聲學模型與聲碼器產生語音。
>
> 現代方法多用深度學習來提升自然度，重點會放在音色、重音、停頓和情緒表現。

### 中英對照與常見說法

| 說法 | 出現場合 |
| --- | --- |
| 語音合成 | 台灣與中國大陸通用的正式用語 |
| 语音合成 | 簡體寫法 |
| Speech Synthesis | 英文原名 |
| TTS（Text-to-Speech，文字轉語音） | 產品與 API 文件裡最常見的說法 |
| 語音生成 | 近年隨生成式模型出現的新說法 |

> 語音合成的範圍比文字轉語音略廣：文字轉語音特指從文字生成，語音合成還包含從其他輸入（例如另一段語音、音素序列）生成人聲。日常對話裡兩者混用不會造成誤解。

### 技術世代

| 世代 | 做法 | 聽起來 |
| --- | --- | --- |
| 串接式（concatenative） | 事先錄大量語音片段，播放時拼接 | 單字清楚但接縫明顯，語調僵硬 |
| 參數式（parametric） | 用統計模型產生聲學參數再合成 | 平順但沉悶，有明顯的機器感 |
| 神經式（neural） | 深度模型直接產生頻譜與波形 | 接近真人，語調自然 |

> 現在的神經式主流是兩段式：**聲學模型**把文字轉成梅爾頻譜圖（決定念什麼、怎麼斷句、語調），**聲碼器**把頻譜還原成波形（決定音質）。近年也有端到端與「把語音當離散 token 用語言模型生成」的做法，後者讓語音合成能力併進大型語言模型。

### 中文語音合成的特殊難點

> **多音字判讀。** 「行」念 xíng 還是 háng、「重」念 zhòng 還是 chóng、「長」念 cháng 還是 zhǎng，必須靠上下文判斷。這一步叫字音轉換（G2P），是中文語音合成錯誤的主要來源。
>
> **三聲連續變調。** 兩個三聲相連時前一個要變成二聲（「你好」實際念成 ní hǎo），沒處理會聽起來很生硬。
>
> **文字正規化。** 數字、日期、單位、英文縮寫都要先決定怎麼念。「3.5」念三點五、「2026/07/29」念年月日、「AI」逐字母念，這些是前處理的規則，不是模型的問題。
>
> **中英夾雜在台灣特別常見**，模型要能在同一句裡切換發音系統而不突兀。

### 評估與使用邊界

> 主要評估方式仍是主觀評分 MOS（請人聽並給 1 到 5 分），客觀指標跟人耳感受的相關性有限。除了自然度，實務上還要看**可懂度**（在吵雜環境聽不聽得清楚）與**一致性**（長篇朗讀時音色會不會飄）。
>
> 語音複製現在只需要幾秒鐘樣本就能模仿一個人的聲音，這帶來明確的濫用風險。使用他人聲音前必須取得授權，多數服務也要求在輸出中揭露是合成語音。

### 情境判斷

> **Q1（直覺題）：** 你想讓電子書自己唸出來，這是語音合成嗎？
>
> → 是，因為輸入是文字，輸出是聲音。
>
> **Q2（判斷題）：** 如果聲音很像機器人、語氣很平，問題通常只在文字內容嗎？
>
> → 不只。看情況，常見原因是韻律建模或聲碼器不夠自然。

### 常見問題

> **Q：語音合成和 TTS 是同一件事嗎？**
> 是，TTS 就是 text-to-speech，中文常說文字轉語音。
>
> **Q：語音合成一定要很像真人嗎？**
> 不一定，重點是要清楚、自然、符合場景，像語音助理和無障礙朗讀就很看用途。
>
> **Q：語音合成可以做多語言嗎？**
> 可以，但通常要處理不同語言的發音規則、韻律和音素對應。

### 相關術語

> - **文字轉語音**：它就是語音合成最直接的另一種說法。
> - **對話式人工智慧**：很多語音合成都會放進對話系統裡，形成完整互動。
> - **聊天機器人**：如果機器不只會打字，還會說話，這個術語就會一起出現。

---

來源：https://aiterms.tw/terms/speech-synthesis
快查頁：https://aiterms.tw/terms/speech-synthesis
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-speech-synthesis