Microsoft VibeVoice:長音檔 ASR、多角色 TTS 與即時語音 AI 的落地判斷
VibeVoice 是 Microsoft 開源語音模型家族:ASR 支援 60 分鐘長音檔;TTS 支援 90 分鐘與 4 speaker;Realtime 0.5B 主打串流 TTS。新增社群補充:它對一人工作室與多角色長篇音訊很有想像空間,但 voice cloning、商用與深偽風險必須按官方限制處理。
官方文件稱 ASR-7B 可在單次輸入中處理最長 60 分鐘音訊,輸出包含說話者、時間戳與內容的結構化 transcription,支援 customized hotwords 與 50+ 語言,並已支援 Transformers / vLLM 部署路徑。
TTS 1.5B 模型定位為長篇、多說話者語音生成,可合成最長約 90 分鐘、最多 4 位說話者的 podcast / conversation 音訊。底層使用 Qwen2.5-1.5B、連續語音 tokenizer 與 next-token diffusion 架構。
Realtime 0.5B 是部署友善的串流 TTS 模型,支援 streaming text input,可讓 LLM 還沒完整輸出完就開始發聲。Hugging Face model card 標示約 300ms first audible latency,但實際延遲依硬體與服務架構而變。
| 使用場景 | 可用 VibeVoice 層 | 仍需補齊 |
|---|---|---|
| 長會議逐字稿 | VibeVoice-ASR 60 分鐘單次處理、Who / When / What 輸出 | 會議平台整合、噪音測試、台灣口音評估、摘要與 action item extraction |
| 多人 podcast / 有聲書 | VibeVoice-TTS 90 分鐘、最多 4 speaker | 腳本分鏡、授權聲音、後製、音量一致性、AI 生成揭露 |
| 即時語音 AI | VibeVoice-Realtime 0.5B streaming TTS | ASR、LLM streaming、barge-in、回合控制、電話 / WebRTC / LiveKit / SIP 串接 |
| 企業內部會議紀錄工具 | ASR + vLLM serving 可做候選 | 隱私、資料保留、權限、稽核、錯字 / 人名 / 術語 hotwords、人工校正流程 |
- 長音檔不必切太碎,理論上可降低 speaker tracking 與上下文斷裂問題。
- ASR 直接輸出 Who / When / What,對會議紀錄 pipeline 很友善。
- vLLM / OpenAI-compatible API 路徑讓服務化比較容易接進既有 agent stack。
- Realtime TTS 讓「邊想邊說」的語音助理更接近產品化體驗。