VoxCPM2 技術卡片:開源 TTS 正從 voice cloning 走向 voice design 與可控語音生成
OpenBMB/VoxCPM2 是 2B 參數、Apache 2.0 的 tokenizer-free diffusion autoregressive TTS 模型,支援 30 種語言、48kHz、Voice Design、Controllable Cloning、Ultimate Cloning 與 streaming。這篇整理官方 README / Hugging Face model card 的可驗證事實,並補上社群討論中的台灣口音與濫用治理提醒。
VibeVoice 更像語音模型家族:ASR 解決長音檔轉錄,Realtime 0.5B 解決低延遲 TTS;VoxCPM2 則聚焦於高品質 TTS、文字捏聲音與聲音克隆。若要做「會議 → 摘要 → 多角色朗讀」或「有聲書 / 角色配音」,兩者是不同層,不是完全替代。
官方 README 的 ecosystem 已列出多個社群整合,包括 ComfyUI-VoxCPM、ComfyUI_RH_VoxCPM、ComfyUI-VoxCPMTTS、TTS WebUI、VoxCPM.cpp、ONNX、ANE 與 Rust reimplementation。這代表 VoxCPM2 正從模型 repo 擴散到創作者工具鏈。
VoxCPM 是 tokenizer-free TTS,直接在連續語音表徵上生成,官方描述為 end-to-end diffusion autoregressive architecture,目的在於避開離散 tokenization 帶來的自然度與表現力限制。
VoxCPM2 為 2B 參數,官方 README / model card 宣稱使用超過 2 million hours 多語語音資料訓練,輸出 48kHz 音訊,built on MiniCPM-4 backbone。
GitHub repo 與 Hugging Face model card 標示 Apache-2.0;官方提供 GitHub、Hugging Face demo、ReadTheDocs 文件與 audio sample demo page。GitHub API 查詢時 repo 已超過 24K stars。
不用 reference audio,只用自然語言描述聲音,例如年齡、性別、語氣、情緒、語速、沙啞感或角色設定,就能生成新聲線。這把 TTS 從「念稿」推向「角色聲音設計」。
提供短 reference clip 後,模型可保留 timbre,再用文字指令控制 emotion、pace、expression。這對創作者很有吸引力,因為它不是只複製聲音,而是能把聲音帶進不同腳本與情緒。