---
title: "聲音轉換（Voice Conversion）"
slug: voice-conversion
language: zh-TW
source: https://aiterms.tw/terms/voice-conversion
updated_at: 2026-06-23
tags: [語音轉換, 音訊處理, 生成對抗網路, 深度學習, 聲音識別]
ipas_term: false
---

# 聲音轉換（Voice Conversion）

將一個說話者的聲音轉換為另一個說話者聲音風格的技術，同時保持語言內容不變。

## 完整說明

聲音轉換（Voice Conversion，VC）是將來源說話者（source speaker）的語音特徵轉換為目標說話者（target speaker）的語音特徵，保留語言內容（詞彙、語調、速度）但改變聲音身份（音色、共振峰特徵）。與說話者識別或說話者驗證不同，聲音轉換是「改變聲音」，在配音、娛樂、無障礙應用中有實用價值，但也因為可能用於冒充而面臨倫理與安全疑慮。

## 常見問題

### 聲音轉換和語音合成的區別是什麼？

語音合成（TTS）的輸入是文字，輸出是語音；聲音轉換（VC）的輸入和輸出都是語音，只是改變發話者身份。換句話說，TTS 是「從零產生語音」，而 VC 是「改造既有語音」。兩者可結合使用：先用 TTS 生成內容（保證內容精確），再用 VC 改變音色以匹配品牌聲音或特定說話者，這在配音產業成為新趨勢。

### 為什麼聲音轉換無法完全保留原聲音的語言內容？

聲音中，說話者身份特徵（共振峰、音色）與語言內容（基頻輪廓、節奏）並非完全獨立。在聲學特徵空間中，轉換頻譜包絡時難免影響某些內容相關的資訊。此外，訓練資料的語言與發音風格限制了模型的泛化能力：如果訓練資料中目標說話者從不說某些音素，模型就無法轉換該音素。預訓練模型（Wav2Vec2）的出現改善了這個問題，透過在內容表示層操作，能更乾淨地分離身份與內容。

### 聲音轉換技術有合法的應用場景嗎？

有的。合法應用包括：一、配音與媒體製作，快速為多語言內容配音；二、無障礙輔助，讓失聲患者恢復類似自己的聲音而非機器音；三、娛樂與遊戲，創造多樣化的 NPC 或虛擬角色聲音；四、個性化語音助手，使助手聲音與品牌或用戶偏好相符。但無論應用場景為何，使用真人聲音訓練聲音轉換模型前必須取得授權，產出內容必須清楚標示為合成或轉換音訊，這正在成為行業與法規的強制要求。

---

來源：https://aiterms.tw/terms/voice-conversion
快查頁：https://aiterms.tw/terms/voice-conversion
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-voice-conversion