載入中...
載入中...
OpenBMB/VoxCPM2 是 2B 參數、Apache 2.0 的 tokenizer-free diffusion autoregressive TTS 模型,支援 30 種語言、48kHz、Voice Design、Controllable Cloning、Ultimate Cloning 與 streaming。這篇整理官方 README / Hugging Face model card 的可驗證事實,並補上社群討論中的台灣口音與濫用治理提醒。
微軟 TRELLIS.2 是 4B 參數 image-to-3D 模型,核心是 O-Voxel:同時承載幾何與 PBR 材質,改善複雜拓撲與可接工作流問題。貼文的「3 秒生成」需加上 H100、512³ 等條件;本地部署也需要 Linux 與至少 24GB NVIDIA GPU。
這則 Threads 真正值得記錄的,不只是 HappyHorse-1.0 突然衝上影片榜,而是它透露出影片生成競爭的新方向:模型不再只比單純畫面品質,而開始比影片與音訊聯合生成、多語言能力,以及是否能用 benchmark 成績快速奪下敘事主導權。
這則 Threads 最重要的訊號不是單一模型更新,而是開源音樂生成模型第一次在主流評測上超過頂級商業模型 Suno v5,且運行門檻已壓到單張消費級顯卡,意味 generative music 很可能開始重演 image、video、LLM 的開源追平—反超劇本。