NVIDIA Nemotron 3.5 ASR:把語音辨識搬回本機的 0.6B 串流模型
NVIDIA Nemotron 3.5 ASR 是 600M 參數、支援多語言與串流輸出的 ASR 模型。它的價值不只是小,而是把低延遲、離線、可插入 agent pipeline 的語音輸入層變得更可部署;但 CPU、台語、雙語混雜與授權條款仍要另外測試。
多語言、串流式 ASR。它把語音轉文字做成可以放進 voice agent / teleprompter / 離線工具鏈的本機元件,而不是只能呼叫雲端 STT API。
600M 參數;Encoder 是 Cache-Aware FastConformer,Decoder 是 RNNT。cache-aware streaming 的價值是少做重複計算,讓 chunk-by-chunk 的即時轉錄更有效率。
Hugging Face model card metadata 列出 35 種語言代碼;正文描述為 40 language-locales。支援中文代碼 zh,但台語、口音、code-switching 仍不能直接等同保證。
可用 NeMo 載入;LiveKit 範例把它包成 OpenAI-style /v1/audio/transcriptions 與 WebSocket 串流端點,因此既能接一般 OpenAI-compatible client,也能進 LiveKit Agents。
語音 agent 的體驗瓶頸常在 turn-taking:人講話、系統收音、ASR 出 partial transcript、LLM 開始思考、TTS 回話。ASR 如果只能等整句結束才輸出,整個互動就會慢半拍。Nemotron 3.5 ASR 的串流與 partial transcript 能讓 pipeline 更早取得文字。
本機 STT 可以降低隱私風險、避免每分鐘計費、支援離線或內網場景。對會議摘要、電話提醒、桌面助理、醫療/客服內網原型來說,這比單純 benchmark 好看更有用。
ASR 的可用性不只取決於參數量。更重要的是語言/口音覆蓋、噪音魯棒性、endpoint latency、partial transcript 穩定性、標點/大小寫、可否熱詞或 domain adaptation。