HappyHorse 1.0 對決 Seedance 2.0:Elo 排名看不到的事
無聲影片的 Elo 榜上 HappyHorse 第一。我們把音訊打開,用三組真實提示詞並排實測,附評分表和寫給 OmniArt 創作者的選購指南。

Artificial Analysis 的排行榜把 HappyHorse 1.0 放在無聲文生影片的第一名,Seedance 2.0 排第二。那是最容易做的比較,也是最無聊的一種——無聲排行榜獎勵的,是在並排播放器裡容易做 A/B 的東西。真實的製作簡報是帶著聲音跑的,有限制條件,而且畫面裡同時有好幾個元素在動。
我們把其中三份簡報餵給兩個模型——一場武士對決、一場爵士演出,還有一個曼谷夜市場景——用七個面向評分,包含音訊同步和整體可用性。Elo 的差距沒有縮小。它反而在我們沒預期的地方,往 HappyHorse 那邊拉得更開。下面是完整的解讀,以及一份給正在 OmniArt 上二選一的創作者、按情境走的選購指南。
HappyHorse 1.0 對決 Seedance 2.0:規格速覽
| 規格 | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| 開發者 | 阿里巴巴(ATH AI 創新部門) | 位元組跳動(Seed Research) |
| 推出時間 | 2026 年 4 月 7 日(競技場)/2026 年 4 月 27 日(API) | 2026 年 2 月 10 日 |
| 架構 | 統一的 40 層自注意力 Transformer(約 150 億參數) | 雙分支擴散 Transformer(DB-DiT) |
| 最高解析度 | 1080p | 最高 2K |
| 最長時長 | 5–15 秒 | 4–15 秒 |
| 音訊 | 影音聯合,單次生成 | 影音聯合,雙分支加交叉注意力 |
| 對嘴 | 7 種語言(英、中、粵、日、韓、德、法) | 多語言,毫秒級同步 |
| 參考素材 | 文字、圖片 | 文字、最多 9 張圖片、3 段影片、3 段音訊 |
| 運鏡控制 | 靠提示詞 | 導演級(運鏡、光線、陰影、表演) |
| Elo:文生影片(無聲) | 約 1,357(第 1) | 約 1,269(第 2) |
| Elo:文生影片(有聲) | 約 1,210(第 2) | 約 1,220(第 1 或並列) |
| 開源 | 已宣布;權重尚未經獨立驗證 | 閉源 |
| API 管道 | fal.ai、Replicate、阿里雲 | 即夢、剪映、BytePlus Ark、fal.ai |
無聲影片上的 Elo 差距大約是 88 分——換算成盲測,HappyHorse 大約有 58% 的勝率。那是公開的評測數字。有趣的問題是:加上聲音、加上複雜度,再套上一份像真實製作需求的評分標準之後,這個差距還在不在。
HappyHorse 1.0 和 Seedance 2.0 到底是什麼
HappyHorse 1.0
HappyHorse 把文字、圖片、影片和音訊的 token 放進同一個序列,穿過 40 層自注意力層一起處理。它生成 1080p 影片,帶七種語言的對嘴、擬音效果和環境音——全部在一次統一的生成裡完成。
這個模型在 2026 年 4 月 7 日匿名出現在 Artificial Analysis Video Arena 上,立刻攻上榜首,72 小時後消失。阿里巴巴後來承認這是他們的模型,並在 4 月 27 日開放 API。
Seedance 2.0
Seedance 用的是雙分支擴散 Transformer:一個分支生成影片,另一個分支生成音訊,交叉注意力在毫秒級把兩者接起來。每次生成最多可以吃 9 張參考圖、3 段影片和 3 個音訊檔,讓你對運鏡、光線和角色表演做到導演級的控制。它在 2026 年 2 月 10 日推出。
說明
最簡短的差別是:HappyHorse 在一次生成裡做出一個統一的視聽體驗。Seedance 用兩個分支分別生成影片和音訊,再把它們同步起來。這個架構選擇,形塑了底下整場比較。
我們怎麼測的
多數比較文章重複同樣的風景和人像測試,那基本上是在重跑 Elo 評測已經量過的東西。我們把焦點放在三個真實的製作情境上,刻意去壓音訊、運鏡行為和多元素協調——也就是無聲排行榜看不到的那些部分。
每次測試都用七個面向評分:
- 畫面品質
- 動態流暢度
- 提示詞遵循度
- 運鏡
- 音訊品質
- 影音同步
- 整體可用性
測試一:電影感動作——竹林對決
Prompt: A lone samurai in black lacquered armor at dawn draws a katana in a dense bamboo forest. Mist, wind sounds, blade ring, temple bells, and a camera pull from tight hand grip to wide tracking shot.
HappyHorse 1.0 的結果。 畫面執行到位——盔甲上的鏡面反射在物理上可信,霧氣有體積感的互動,拔刀有真實的重量。音訊同步是最亮眼的:刀刃的金屬鳴響和視覺上的拔刀緊密同步,不早也不晚,就落在對的格子上。統一架構在這裡回本了——單流的 Transformer 把視覺和聲音當成同一個事件的兩個部分,而你聽得出這個差別。
Seedance 2.0 的結果。 畫面精細度明顯低一階——盔甲質感比較軟,霧的體積感比較弱。運鏡執行在這裡贏了:從特寫拉到廣角的那個動作起點更貼近指示,感覺是排練過的,而不是大概抓一下。音訊少了 HappyHorse 那種空間沉浸感——聲音都貼在鏡頭旁邊,沒有散佈到整個場景裡。
測試一評分表:
| 面向 | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| 畫面品質 | ✓ | |
| 動態流暢度 | ✓ | |
| 提示詞遵循度 | ✓ | |
| 運鏡 | ✓ | |
| 音訊品質 | ✓ | |
| 影音同步 | ✓ | |
| 整體可用性 | ✓ |
判定: HappyHorse 拿下七項中的六項。Seedance 的運鏡精準度是真的——它更忠實地執行了從特寫拉到廣角——但那補不回音訊上的落差。
測試二:音樂演出——Blue Note 的最後一首
Prompt: A jazz singer in crimson velvet under amber spotlight performs with piano accompaniment. Cigarette smoke, glass clinks, muffled conversation, and a slow camera push-in as the melody builds.
HappyHorse 1.0 的結果。 絲絨的光澤看起來很真;煙感覺是被物理模擬出來的,而不是畫上去的。歌手的擺動有自然的律動,不是那種一眼就看出是 AI 音樂錄影帶的機械式擺盪。音訊的勝出幅度更大:人聲演唱和鋼琴伴奏像同一個音樂事件互相靠著彼此。嘴型跟著旋律線走,沒有出現我們預期的中段脫節。這個模型不是事後把兩條分開的串流對上——它是在生成一個統一的視聽體驗。
Seedance 2.0 的結果。 畫面扎實但氛圍比較薄——絲絨比較不可信,煙比較沒動態。音訊漏掉了完整的聲景:這間爵士酒吧應該要有玻璃杯碰撞和聽眾模糊交談的層次,但在 Seedance 的輸出裡,這些環境細節不是太弱就是不見了。運鏡執行維持紀律——推近比 HappyHorse 更照字面走,從中景到特寫,跟指示一致。
測試二評分表:
| 面向 | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| 畫面品質 | ✓ | |
| 動態流暢度 | ✓ | |
| 提示詞遵循度 | ✓ | |
| 運鏡 | ✓ | |
| 音訊品質 | ✓ | |
| 影音同步 | ✓ | |
| 整體可用性 | ✓ |
判定: HappyHorse 這一回合贏得比預期更乾脆。Seedance 處理得了主唱加鋼琴這個主結構,但它漏掉太多關於整個空間的聲音指示,做音樂類簡報時還輪不到它。
測試三:多元素場景——夜市的火
Prompt: A Bangkok street food vendor tosses a wok over towering flame at night. Fire dynamics, six customers, a woman filming with a glowing phone screen, handheld documentary camera, and audio including burner roar, sizzling oil, Thai orders, traffic, and distant pop music.
HappyHorse 1.0 的結果。 火焰動態很驚人——火舌回應著鍋子的甩動,物理很有說服力,火星散開的軌跡也可信。甩麵的弧線和時機都對。音訊撐起了爐火的轟鳴、油的滋滋聲、車流,還有更廣的街道氛圍。不過人的表演掉鏈子:攤販和客人都在,但他們的臉沒有對熱氣、速度和人來人往做出自然的反應。
Seedance 2.0 的結果。 視覺上沒那麼炸,但整個場景讀起來更連貫。鏡頭語言很出色——手持的晃動有目的性,景深的變化引導了注意力,這支片從火焰到攤販再到人群的順序也更清楚。人的行為更可信——攤販的動作、客人的注意力和人群的反應,都比 HappyHorse 那種比較僵硬的人物表演更貼合情境。音訊的完整度不夠:基本的滋滋聲和街道環境音有,但泰語叫單的攤販聲不見了。
測試三評分表:
| 面向 | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| 畫面品質 | ✓ | |
| 動態流暢度 | ✓ | |
| 提示詞遵循度 | ✓ | ✓ |
| 運鏡 | ✓ | |
| 音訊品質 | ✓ | |
| 影音同步 | ✓ | |
| 整體可用性 | ✓ | ✓ |
判定: 這是最接近的一回合。HappyHorse 抓到更多要求的視覺和聲音元素;Seedance 把這個場景講得更好。
整體結果
| 面向 | HappyHorse 勝 | Seedance 勝 | 平手 |
|---|---|---|---|
| 畫面品質 | 3 | 0 | 0 |
| 動態流暢度 | 2 | 1 | 0 |
| 提示詞遵循度 | 2 | 1 | 1 |
| 運鏡 | 0 | 3 | 0 |
| 音訊品質 | 3 | 0 | 0 |
| 影音同步 | 3 | 0 | 0 |
| 整體可用性 | 2 | 0 | 1 |
意外的不是 HappyHorse 在畫面上贏——排行榜早就講過了。意外的是 HappyHorse 在音訊上也贏。加上聲音之後差距變大,而不是變小。統一架構產出的視聽體驗,比「先分開再同步」那條路更整體。
社群怎麼說
創作者串裡的風向,集中在幾個一致的主題:
- 畫質有共識。 視覺差距很明顯;愈來愈多人提到音訊比預期更強,尤其是環境聲景和擬音。
- 上線流程有優勢。 一講到可重現性、靠參考素材控制和被導演過的工作流,大家會點頭給 Seedance。
- 共同的老問題。 兩個模型在精準的多角色站位上都還是會卡。
- 看任務挑模型。 想要單次生成就最強的一支片,用 HappyHorse。需要拿參考素材去指揮輸出,用 Seedance。
社群的讀法和上面的測試結果是一致的。
音訊的落差為什麼讓我們意外
Artificial Analysis Video Arena 做的是盲測視覺比較,使用者並排比較沒有標籤的片子。無聲影片測試裡,HappyHorse 領先約 88 個 Elo 分。加上音訊之後,公開分數收斂到幾乎平手,看起來像是 Seedance 的分支架構追上來了。
但實務上——用正常速度、開著聲音看完整支片——HappyHorse 的優勢沒有縮小,反而擴大了。為什麼?因為短片的孤立 A/B 比較會放大明顯的聲音事件(一聲刀鳴、一個鋼琴音),而不是環境的整體感。而環境的整體感,正是 HappyHorse 那種統一單次生成拉開差距的地方。
什麼時候選 HappyHorse 1.0
- 單支片的品質最重要
- 需要沉浸式環境聲景的專案
- 快速迭代(H100 上一支 5 秒的 1080p 片約 38 秒)
- 創意優先的工作——情緒板、社群主打片
- 需要多語言對嘴的講話人頭(7 種語言)
什麼時候選 Seedance 2.0
- 要導演級的輸入控制(最多 9 張參考圖、3 段影片、3 個音訊檔)
- 運鏡精準度和分鏡遵循度
- 角色和道具要一致的多鏡頭序列
- 需要穩定性和成熟文件的製作流程
HappyHorse 還是 Seedance:依情境選
| 情境 | 首選 | 為什麼 |
|---|---|---|
| 社群主打片 | HappyHorse | 單支片最強,音訊有沉浸感 |
| 有指定鏡頭的商品廣告 | Seedance | 運鏡控制加上靠參考素材維持一致 |
| 音樂錄影帶 | HappyHorse | 影音生成更整體 |
| 多鏡頭敘事序列 | Seedance | 參考系統讓鏡頭之間保持一致 |
| 概念探索/情緒板 | HappyHorse | 視覺天花板最高,生成快 |
| 需要精準對嘴的講話人頭 | HappyHorse | 七種語言的對嘴都很強 |
| 照分鏡走的製作 | Seedance | 更忠實地執行運鏡和鏡頭指示 |
| 有氛圍的電影感空景 | HappyHorse | 環境音加上視覺的戲劇性 |
| 從參考素材出發的受控場景 | Seedance | 9 張圖加 3 段影片的參考系統 |
| 快速的客戶提案 | HappyHorse | 快,而且第一格的衝擊力最強 |
HappyHorse 1.0 對決 Seedance 2.0:常見問題
HappyHorse 1.0 比 Seedance 2.0 好嗎?
在我們的測試裡,HappyHorse 在大多數面向都產出更強的結果——畫面品質、動態流暢度、音訊豐富度,以及整支片的可用性。Seedance 在運鏡精準度和靠參考素材被指揮的能力上勝出。
HappyHorse 1.0 會生成音訊嗎?
會。HappyHorse 在生成影片的同一次過程裡就原生生成音訊,包含七種語言(英語、國語、粵語、日語、韓語、德語、法語)的對白與對嘴、擬音和環境音。
哪個比較快?
HappyHorse 在 H100 的機器上,一支 5 秒的 1080p 片大約 38 秒。Seedance 的生成時間依平台和設定而異,但大致落在類似的區間。
HappyHorse 1.0 真的開源了嗎?
阿里巴巴已經宣布會開源權重、蒸餾模型和推論程式碼。截至 2026 年 5 月,這個模型可以透過 fal.ai、Replicate 和阿里雲的 API 使用。GitHub 或 Hugging Face 上經獨立驗證的公開權重,目前仍未獲得確認。
Seedance 2.0 的畫面品質追得上 HappyHorse 嗎?
在逐格比較裡,HappyHorse 一貫產出更銳利的質感、更有戲的光線和更流暢的動態。Seedance 的畫面很扎實,但就是低一階。
哪個處理複雜提示詞比較好?
HappyHorse 從複雜提示詞裡產出的東西更驚人,但有時候會對運鏡和空間指示做出自己的創意詮釋。Seedance 更照字面執行詳細的提示詞指示。
兩個模型都支援圖生影片嗎?
都支援。兩個都吃參考圖當輸入並據此生成影片。在公開評測上,HappyHorse 的圖生影片 Elo(約 1,392)領先 Seedance(約 1,351)。
最終判定:HappyHorse 1.0 對決 Seedance 2.0
HappyHorse 的統一架構全面產出更完整的一支片——更好的畫格、更自然的動態、更沉浸的聲景。Seedance 並不是比較弱的模型,它是另一種工具。它導演級的參考系統、可預測的運鏡執行和成熟的製作生態,讓它在你需要控制輸出、而不是被輸出驚豔的時候,成為對的選擇。
2026 年最強的工作流是兩個都用:HappyHorse 負責主打鏡頭、概念探索,還有那種要讓人滑到一半停下來的片子。Seedance 負責被指揮過的序列、對得上的剪接點,以及那條以可重現性為目的的製作流程。
想更深入了解多鏡頭生成和它的走向,可以看我們的姊妹篇 BACH AI 影片生成器。
在 OmniArt 上開始
打開 OmniArt 影片工作台裡的 Happy Horse 1.0,用同一份簡報和 Seedance 比一比——同一組提示詞、同一批參考素材、並排的輸出——不用在不同帳號和不同計價方式之間切來切去。拿上面那份七面向評分表,跑你自己的製作提示詞。贏的那個模型不是 Elo 最高的那個,而是用最少次數就把你的草稿帶到「過了」的那個。
準備好開始創作了嗎?
用 AI 生成精彩內容