載入中...
載入中...
Hugging Face 的 speech-to-speech repo 是 Apache-2.0 的本機語音 agent pipeline,串起 VAD → STT → LLM → TTS,提供 OpenAI Realtime-compatible WebSocket。它可以 fully local,但預設 quickstart 仍用 OpenAI-compatible LLM API;若要完全本地,需要另跑 llama.cpp/vLLM/MLX-LM 等 LLM backend,並注意模型授權與 GPU/Apple Silicon/CUDA 相容性。
Persona 是 xikhar 開源的跨平台桌面角色 presence,支援匯入 VRM / VRMA,讓語音對話有視覺化 avatar;本文校正 Threads hype:它不是自動生成角色動作,而是依 catalog / 設定觸發模型與動畫。
Jerry Lin 分享 lazyjerry/audio-transcribe-skill:Claude Code/Codex 呼叫時委派 agy -p 讓 Gemini 原生多模態音訊理解轉錄,逐字稿與 SRT 寫檔,stdout 只回路徑,避免大量 transcript 回流到 Claude Code context。本文查核 README 與授權 caveat,整理可用場景。
Threads 提到可在 Claude Code 中呼叫 Seedance 生成影片,不必訂固定月費方案。本文查核 ByteDance Seedance 官方頁、VibeFrame、RunAPI Seedance MCP、HiAPI Seedance skill,整理自帶 API key、dry-run、max-cost、任務輪詢與素材產出追蹤的實務架構。
Threads 討論用 Gemini / Antigravity CLI 的原生音訊理解能力,要求模型直接讀音檔轉逐字稿,而不是呼叫 Whisper/ffmpeg。本文整理這個 workflow 的價值、限制與 Allen/Hermes 可用的安全邊界。
Threads 推薦 Whisper Live 作為即時、免費、可本機部署的語音轉文字工具。本文查核 collabora/WhisperLive 與 WhisperLiveKit,整理它們對 Allen 即時語音客服、會議記錄與私有語音輸入介面的可用性與限制。
兩則 Threads 貼文分別展示了 Codex skill 串 HeyGen + MiniMax 快速生成授權數字人口播,以及 GPT-Live / OpenAI Realtime 搭配 LiveTalking、MuseTalk、Wav2Lip 類即時流式數字人的趨勢。本文驗證 GitHub repo、授權與成本聲稱,並整理對 BigIntTech 低延遲語音客服與 AI 角色產品的架構啟示。
Whispurr 是一款 macOS 26 選單列語音聽寫工具,主打本機離線、中文與英文 code-switching、按住 fn 說話後自動整理文字並插入游標位置。它使用 Apple Speech API 與 Apple Intelligence,適合習慣用語音寫程式的人;但目前 GitHub repo 尚未提供開源授權,README 也註明 reuse 前需詢問,若要商用或二次開發需先釐清授權。
OpenFormosa BlueMagpie-TTS 是面向台灣口音與中英混合語境的開源 TTS 模型,保留 VoxCPM 聲學架構並換上 Barbet 文字語意模型;官方提供 GitHub、Hugging Face 模型與 Demo,但也提醒授權與人工審核邊界。