Voice / Speech / Multimodal
Hugging Face speech-to-speech:OpenAI Realtime 相容的本地語音 Agent 管線(全本地 caveat)
Hugging Face 的 speech-to-speech repo 是 Apache-2.0 的本機語音 agent pipeline,串起 VAD → STT → LLM → TTS,提供 OpenAI Realtime-compatible WebSocket。它可以 fully local,但預設 quickstart 仍用 OpenAI-compatible LLM API;若要完全本地,需要另跑 llama.cpp/vLLM/MLX-LM 等 LLM backend,並注意模型授權與 GPU/Apple Silicon/CUDA 相容性。
2026年7月30日1 分鐘閱讀👁 10
Voice AI / Local Agents
Speech-to-speech 的價值:把 VAD、STT、LLM、TTS 串成可替換 pipeline
Threads 說 Hugging Face 出品的 speech-to-speech 可在自己的電腦上跑語音助理。官方 repo huggingface/speech-to-speech 確認存在,定位為用開源模型建立 local voice agents,並暴露 OpenAI Realtime-compatible WebSocket API。
整理原則:Threads 是線索,不是事實終點;本文已盡量以官方網站、GitHub、Steam、README 或公開登記來源交叉查證,未能獨立驗證者明確標為 source-claimed / social-claimed。
| 元件 | 預設 / 支援 |
|---|---|
| VAD | Silero VAD v5 |
| STT | Parakeet TDT |
| LLM | OpenAI-compatible API、HF Inference Providers、OpenRouter,或本地 vLLM / llama.cpp / Transformers / MLX-LM |
| TTS | Qwen3-TTS 等 |
| API | Realtime WebSocket,預設 ws://localhost:8765/v1/realtime |
重要校正:它可以全本地,但預設 quickstart 不是完全離線,因為 LLM 預設走 OpenAI-compatible API 且需要 API key。要真正「零訂閱」,需要自己跑 local LLM,成本改成 GPU/延遲/維運。
對 Allen 語音 AI 專案的意義
- 適合拿來當本機 speech-to-speech baseline,尤其比較 Chatterbox TTS + faster-whisper + 外部 LLM 的延遲。
- 可測 OpenAI Realtime-compatible 介面是否能接現有 voice UI。
- 要單獨驗證 barge-in、長對話記憶、RAG、中文/台灣口音 STT、TTS 自然度與 GPU 需求。