AI Tools
XTTS v2:6 秒聲音樣本就能跨語言複製聲線,但授權與維護狀態要先看清楚
整理 Coqui XTTS v2 的核心能力:6 秒聲音樣本、17 種語言、跨語言 voice cloning、24kHz 輸出,以及使用時必須注意的 Coqui Public Model License 與社群維護現況。
2026年5月10日2 分鐘閱讀👁 4
AI Voice / Open Source TTS
XTTS v2 的價值:把「聲音複製」從大型錄音專案,降到 6 秒參考音檔即可實驗
Threads 原文推薦 Coqui XTTS v2 作為開源語音合成方案。官方 Hugging Face model card 確認:XTTS v2 支援 17 種語言、6 秒 voice cloning、跨語言聲音複製與 24kHz 輸出。它適合快速做多語音助理、有聲書 Demo、旁白生成與語音產品原型,但不能只看「免費開源」四個字,授權是 Coqui Public Model License,不是一般 MIT/Apache。
核心能力
用一段約 6 秒的 speaker_wav 作為參考,輸入文字與語言代碼,就能生成接近該聲線的語音。官方列出 emotion/style transfer、cross-language voice cloning、多語言 speech generation 與 24kHz sampling rate。
支援語言
官方 model card 列出 17 種:英文、西文、法文、德文、義大利文、葡萄牙文、波蘭文、土耳其文、俄文、荷蘭文、捷克文、阿拉伯文、中文、日文、匈牙利文、韓文、印地文。
適合場景
有聲書草稿、多語言語音助理、客服語音原型、教學旁白、遊戲角色語音、內部工具 Demo。若要正式商用,需先確認授權、肖像聲音同意與合成語音標示規範。
授權提醒:XTTS v2 模型本身標示為 Coqui Public Model License(CPML),Coqui TTS 程式庫則是 MPL-2.0。這代表「程式碼開源」與「模型權重可用」是兩件事;產品化前應逐條檢查 CPML 對商用、再散布、生成內容與責任的限制。
| 項目 | 官方資訊 | 實務解讀 |
|---|---|---|
| 聲音樣本 | 6 秒音檔即可 voice cloning | 非常適合快速 Demo;品質仍受錄音乾淨度影響 |
| 輸出品質 | 24kHz sampling rate | 足以做多數網路內容與產品原型 |
| 語言 | 17 種語言,含中文、日文、韓文 | 適合跨語言角色聲線,但不同語言自然度仍要實測 |
| 延伸能力 | 支援 fine-tuning、multiple speaker references | 可往品牌聲音、角色聲音或特定語氣調整 |
| 維護狀態 | GitHub repo 仍有社群討論與大量 stars,但主分支更新需個別檢查 | 正式導入前要做 Python 版本、相依套件、GPU 與 Docker 驗證 |
快速測試:先用 Hugging Face Space 或本機 TTS API 產生 3–5 段不同語言樣本,比較音色一致性與延遲。
產品化前:確認聲音來源取得明確同意,避免未授權 clone 他人聲音。
工程落地:把模型載入時間、GPU VRAM、併發量、音訊後處理與快取策略列入評估。
from TTS.api import TTS
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True)
tts.tts_to_file(
text="It took me quite a long time to develop a voice.",
file_path="output.wav",
speaker_wav="/path/to/target/speaker.wav",
language="en",
)