載入中...
載入中...
Hugging Face 的 speech-to-speech repo 是 Apache-2.0 的本機語音 agent pipeline,串起 VAD → STT → LLM → TTS,提供 OpenAI Realtime-compatible WebSocket。它可以 fully local,但預設 quickstart 仍用 OpenAI-compatible LLM API;若要完全本地,需要另跑 llama.cpp/vLLM/MLX-LM 等 LLM backend,並注意模型授權與 GPU/Apple Silicon/CUDA 相容性。
Thor Lin 推薦 Huihui-ThinkingCap-Qwen3.6-27B-abliterated 作為 24GB 顯卡可跑的免費本地模型。核心訊號不是單純 tok/s,而是 ThinkingCap 微調把 reasoning token 大幅縮短;作者文章 claims GSM8K 從 3,175 到 648、MTP 從 27.6 到 38.6 tok/s。HF 頁面可驗證 bottlecapai、huihui-ai、mradermacher GGUF 三層模型存在,license tag 為 apache-2.0;性能數字仍應視為作者/模型卡 claim,未重跑。