AI / Tools / Workflow
會議逐字稿模型實測:榜單第一不等於台灣中英混講最準
Dawson Wang 實測七種本地語音辨識模型,發現公開榜單高分的 SenseVoice、Qwen3-ASR 在台灣腔中文夾英文工程術語會議裡反而翻車;Mac 上最準是 mlx-whisper large-v3,但 Linux/Vexa 實務部署更適合 faster-whisper large-v3。
2026年6月9日2 分鐘閱讀👁 7
Local ASR / Meeting Transcription
會議逐字稿模型實測:榜單第一不等於台灣中英混講最準
Dawson Wang 用台灣腔中文夾英文工程術語的真實會議錄音,實測七種本地 STT/ASR 模型。純準度在 Mac 上是 mlx-whisper large-v3 勝出;但若要放進 Linux 容器型會議機器人 Vexa,能落地的選擇是 faster-whisper large-v3。
核心判斷:挑會議逐字稿模型不要只看公開榜單。公開榜單測的是別人的資料;真正會讓模型翻車的,往往是自己的場景:台灣口音、中文夾英文、工程術語、人名、產品名、快速對話與噪音。
原文測試設計
原文從一場 63 分鐘真實會議裡剪出最難的 5 分鐘:兩位台灣男生快速討論 git 分支策略,中文句子中混入 trunk-based、release branch、commit、tag、sync、Hotfix 等英文工程詞。作者用 5 個 AI 評審比對七種模型輸出。
最準
mlx-whisper large-v3:9.12 分,5 個評審一致選第一;trunk-based、sync、tag 大致正確;63 分鐘約 320 秒跑完。
最能上線
faster-whisper large-v3:在 Linux/CPU 容器環境可放進 Vexa,RTF 約 0.44,仍有即時串流餘裕。
最容易踩坑
SenseVoice、Paraformer、Qwen3-ASR 等榜單或規格看起來強的模型,在這段工程會議裡把 trunk-based、tag、sync、commit 等詞聽錯或改寫。
落地選型的正確問題
- 台灣國語、英文術語、公司內部名詞、人名與產品名是否準?
- 是否能固定輸出繁體,而不是簡繁漂移?
- 是否能在實際部署環境跑:Mac Metal、Linux CPU、GPU container、或雲端 API?
- RTF 是否小於 1,且有足夠餘裕支撐即時串流?
- 是否會有重複迴圈、漏段、順序錯亂、標點不穩、長音檔 drift?
- 逐字稿後處理是否能補上 domain glossary、繁體化與人名校正?
Kate 的保守結論:個人 Mac 離線處理可先測 mlx-whisper large-v3;部署在 Linux container 的會議 bot,faster-whisper large-v3 更像產品方案。任何新模型都應拿 Allen 自己最難的錄音片段做 5 分鐘驗收,而不是看榜單。