Voice / Speech / Multimodal
Persona:讓 ChatGPT / 語音 AI 有 VRM 角色外觀的桌面 presence
Persona 是 xikhar 開源的跨平台桌面角色 presence,支援匯入 VRM / VRMA,讓語音對話有視覺化 avatar;本文校正 Threads hype:它不是自動生成角色動作,而是依 catalog / 設定觸發模型與動畫。
2026年7月30日1 分鐘閱讀👁 7
Threads 將 Persona 形容成「讓 ChatGPT 變成芙莉蓮」的開源專案:匯入 VRM 模型後,語音 AI 可以有 3D 角色外觀、招手、做動作、講話。這個方向很適合 AI companion / voice assistant / Vtuber demo,但需要把 hype 降回實作邊界:Persona 是桌面角色 presence,不是任意文字指令都能即時生成全新動作。
Reality check:xikhar/persona 描述為「Bringing real-time voice to life」,GitHub 約 497 stars(2026-07-30)。Repo metadata 顯示 license 為 NOASSERTION,但 LICENSE 文字為 MIT;同時明確註明 public/assets/ 下角色資產不適用此 license。
Persona 實際做什麼
- 提供跨平台桌面角色,讓語音對話有可視化 identity。
- 支援 Linux PipeWire、Windows WASAPI process-loopback、macOS Core Audio process tap 監聽特定應用播放聲音。
- 不捕捉麥克風、不儲存音訊、不產生語音、不轉錄內容、不把音訊傳到網路;它是聽「應用輸出」來驅動表現。
- 可匯入本地
.vrm模型與.vrma動畫,透過 catalog / manifest 宣告模型與動畫。
Threads hype vs. README 邊界
| 說法 | 校正 |
|---|---|
| 「只要叫她打招呼,她就招手」 | 可以做出互動效果,但主要依賴已準備的 VRM / VRMA 與設定觸發;不是自然語言任意生成骨架動畫。 |
| 「AI Vtuber 最終型態」 | 比較像 voice assistant 的桌面角色層;完整 Vtuber 還需要直播串流、情緒模型、TTS、ASR、記憶、內容安全與互動管理。 |
| 「開源可直接商用」 | 程式 license 可依 MIT 解讀,但角色資產另計;動漫角色如芙莉蓮涉及 IP / 模型授權,不能混為一談。 |
對 Allen 語音 AI 的價值
Demo 觀感
讓語音客服 / Kate voice reminder 從純聲音變成有形象的互動視窗,對投資人 demo 或內部展示有加分。
技術組合
可與既有 STT / TTS / LLM 管線分層整合:Persona 做視覺 presence,語音與思考仍由後端 agent 處理。
風險
角色模型授權、macOS audio permission、GPU / 圖形效能、動畫 catalog 製作成本。
PoC 建議
- 先用無 IP 風險的原創 / 商用 VRM 模型。
- 只做 3–5 個固定情境:打招呼、聆聽、思考、提醒、完成。
- 把 Persona 視為前端 presence,不要讓它綁死核心 voice-agent pipeline。
來源:Threads 原文;。