HappyHorse-1.0 為什麼值得注意:匿名開源影片模型正在用「影音一體化」搶榜與搶敘事
這則 Threads 真正值得記錄的,不只是 HappyHorse-1.0 突然衝上影片榜,而是它透露出影片生成競爭的新方向:模型不再只比單純畫面品質,而開始比影片與音訊聯合生成、多語言能力,以及是否能用 benchmark 成績快速奪下敘事主導權。
title: HappyHorse-1.0 為什麼值得注意:匿名開源影片模型正在用「影音一體化」搶榜與搶敘事 date: 2026-04-09 source: https://www.threads.com/@yrzheee/post/DW3GE6-DllY category: articles tags:
- HappyHorse
- Video Generation
- Text to Video
- Image to Video
- Open Source AI
- Audio Video created: 2026-04-09 updated: 2026-04-09
HappyHorse-1.0 為什麼值得注意:匿名開源影片模型正在用「影音一體化」搶榜與搶敘事
概要
這則 Threads 的戲劇性很強:一個叫 HappyHorse-1.0 的匿名影片模型,突然空降 Artificial Analysis 的全球影片排行榜前列。
貼文給出的關鍵數據是:
- 無音訊 T2V:ELO 1357,#1
- 有音訊 T2V:ELO 1204,#2(僅次 Seedance 2.0)
- I2V:ELO 1392,且明顯領先
同時它還宣稱:
- 40 層單流 Transformer
- 只需 8 步去噪
- 無需 CFG
- 支援 影片 + 音訊聯合生成
- 支援中英日韓德法 6 種語言
- 承諾完全開源,但權重尚未釋出
如果只把這件事看成「又一個模型刷榜」,就太淺了。這篇真正值得 Allen KB 記錄的,是它反映出影片生成競爭的三個新變化:
影片模型正在從單純比畫面品質,轉向比影音一體化能力;開源敘事正在快速追上;而匿名團隊也能靠 benchmark 成績瞬間搶下市場注意力。
這篇真正的重點
1. 影片生成的競爭,開始從「畫面」升級成「完整媒體片段」
過去很多 text-to-video 討論,主要還停在:
- 畫面好不好看
- 動作順不順
- 鏡頭穩不穩
- 人物變形多不多
但這篇最值得注意的一點,是它把 音訊 拉進來一起講。
這很關鍵,因為當模型能做到:
- 畫面生成
- 音效生成
- 多語言 prompt 理解
- 一步產出更完整的 audiovisual clip
競爭維度就變了。
也就是說,市場開始不只在比「video generator」,而是在比:
誰更接近一個完整的 generative media engine。
這會直接影響未來產品形態,因為使用者真正要的通常不是無聲樣片,而是可直接進入短影音、demo、內容創作流程的成品。
2. 匿名模型也能靠 benchmark 快速奪權
這篇的戲劇性,還來自另一個點:
沒人知道 HappyHorse 是誰做的。
貼文提到社群的三種猜測:
- 阿里萬相 Wan 2.7 換皮