Industry模型與觀察閱讀時間 20 分鐘

HappyHorse 1.0 對決 Seedance 2.0:Elo 排名看不到的事

無聲影片的 Elo 榜上 HappyHorse 第一。我們把音訊打開,用三組真實提示詞並排實測,附評分表和寫給 OmniArt 創作者的選購指南。

OmniArt 團隊
HappyHorse 1.0 對決 Seedance 2.0:Elo 排名看不到的事

Artificial Analysis 的排行榜把 HappyHorse 1.0 放在無聲文生影片的第一名,Seedance 2.0 排第二。那是最容易做的比較,也是最無聊的一種——無聲排行榜獎勵的,是在並排播放器裡容易做 A/B 的東西。真實的製作簡報是帶著聲音跑的,有限制條件,而且畫面裡同時有好幾個元素在動。

我們把其中三份簡報餵給兩個模型——一場武士對決、一場爵士演出,還有一個曼谷夜市場景——用七個面向評分,包含音訊同步和整體可用性。Elo 的差距沒有縮小。它反而在我們沒預期的地方,往 HappyHorse 那邊拉得更開。下面是完整的解讀,以及一份給正在 OmniArt 上二選一的創作者、按情境走的選購指南。

HappyHorse 1.0 對決 Seedance 2.0:規格速覽

規格HappyHorse 1.0Seedance 2.0
開發者阿里巴巴(ATH AI 創新部門)位元組跳動(Seed Research)
推出時間2026 年 4 月 7 日(競技場)/2026 年 4 月 27 日(API)2026 年 2 月 10 日
架構統一的 40 層自注意力 Transformer(約 150 億參數)雙分支擴散 Transformer(DB-DiT)
最高解析度1080p最高 2K
最長時長5–15 秒4–15 秒
音訊影音聯合,單次生成影音聯合,雙分支加交叉注意力
對嘴7 種語言(英、中、粵、日、韓、德、法)多語言,毫秒級同步
參考素材文字、圖片文字、最多 9 張圖片、3 段影片、3 段音訊
運鏡控制靠提示詞導演級(運鏡、光線、陰影、表演)
Elo:文生影片(無聲)約 1,357(第 1)約 1,269(第 2)
Elo:文生影片(有聲)約 1,210(第 2)約 1,220(第 1 或並列)
開源已宣布;權重尚未經獨立驗證閉源
API 管道fal.ai、Replicate、阿里雲即夢、剪映、BytePlus Ark、fal.ai

無聲影片上的 Elo 差距大約是 88 分——換算成盲測,HappyHorse 大約有 58% 的勝率。那是公開的評測數字。有趣的問題是:加上聲音、加上複雜度,再套上一份像真實製作需求的評分標準之後,這個差距還在不在。

HappyHorse 1.0 和 Seedance 2.0 到底是什麼

HappyHorse 1.0

HappyHorse 把文字、圖片、影片和音訊的 token 放進同一個序列,穿過 40 層自注意力層一起處理。它生成 1080p 影片,帶七種語言的對嘴、擬音效果和環境音——全部在一次統一的生成裡完成。

這個模型在 2026 年 4 月 7 日匿名出現在 Artificial Analysis Video Arena 上,立刻攻上榜首,72 小時後消失。阿里巴巴後來承認這是他們的模型,並在 4 月 27 日開放 API。

Seedance 2.0

Seedance 用的是雙分支擴散 Transformer:一個分支生成影片,另一個分支生成音訊,交叉注意力在毫秒級把兩者接起來。每次生成最多可以吃 9 張參考圖、3 段影片和 3 個音訊檔,讓你對運鏡、光線和角色表演做到導演級的控制。它在 2026 年 2 月 10 日推出。

說明

最簡短的差別是:HappyHorse 在一次生成裡做出一個統一的視聽體驗。Seedance 用兩個分支分別生成影片和音訊,再把它們同步起來。這個架構選擇,形塑了底下整場比較。

我們怎麼測的

多數比較文章重複同樣的風景和人像測試,那基本上是在重跑 Elo 評測已經量過的東西。我們把焦點放在三個真實的製作情境上,刻意去壓音訊、運鏡行為和多元素協調——也就是無聲排行榜看不到的那些部分。

每次測試都用七個面向評分:

  • 畫面品質
  • 動態流暢度
  • 提示詞遵循度
  • 運鏡
  • 音訊品質
  • 影音同步
  • 整體可用性

測試一:電影感動作——竹林對決

Prompt: A lone samurai in black lacquered armor at dawn draws a katana in a dense bamboo forest. Mist, wind sounds, blade ring, temple bells, and a camera pull from tight hand grip to wide tracking shot.

HappyHorse 1.0 的結果。 畫面執行到位——盔甲上的鏡面反射在物理上可信,霧氣有體積感的互動,拔刀有真實的重量。音訊同步是最亮眼的:刀刃的金屬鳴響和視覺上的拔刀緊密同步,不早也不晚,就落在對的格子上。統一架構在這裡回本了——單流的 Transformer 把視覺和聲音當成同一個事件的兩個部分,而你聽得出這個差別。

Seedance 2.0 的結果。 畫面精細度明顯低一階——盔甲質感比較軟,霧的體積感比較弱。運鏡執行在這裡贏了:從特寫拉到廣角的那個動作起點更貼近指示,感覺是排練過的,而不是大概抓一下。音訊少了 HappyHorse 那種空間沉浸感——聲音都貼在鏡頭旁邊,沒有散佈到整個場景裡。

測試一評分表:

面向HappyHorse 1.0Seedance 2.0
畫面品質
動態流暢度
提示詞遵循度
運鏡
音訊品質
影音同步
整體可用性

判定: HappyHorse 拿下七項中的六項。Seedance 的運鏡精準度是真的——它更忠實地執行了從特寫拉到廣角——但那補不回音訊上的落差。

測試二:音樂演出——Blue Note 的最後一首

Prompt: A jazz singer in crimson velvet under amber spotlight performs with piano accompaniment. Cigarette smoke, glass clinks, muffled conversation, and a slow camera push-in as the melody builds.

HappyHorse 1.0 的結果。 絲絨的光澤看起來很真;煙感覺是被物理模擬出來的,而不是畫上去的。歌手的擺動有自然的律動,不是那種一眼就看出是 AI 音樂錄影帶的機械式擺盪。音訊的勝出幅度更大:人聲演唱和鋼琴伴奏像同一個音樂事件互相靠著彼此。嘴型跟著旋律線走,沒有出現我們預期的中段脫節。這個模型不是事後把兩條分開的串流對上——它是在生成一個統一的視聽體驗。

Seedance 2.0 的結果。 畫面扎實但氛圍比較薄——絲絨比較不可信,煙比較沒動態。音訊漏掉了完整的聲景:這間爵士酒吧應該要有玻璃杯碰撞和聽眾模糊交談的層次,但在 Seedance 的輸出裡,這些環境細節不是太弱就是不見了。運鏡執行維持紀律——推近比 HappyHorse 更照字面走,從中景到特寫,跟指示一致。

測試二評分表:

面向HappyHorse 1.0Seedance 2.0
畫面品質
動態流暢度
提示詞遵循度
運鏡
音訊品質
影音同步
整體可用性

判定: HappyHorse 這一回合贏得比預期更乾脆。Seedance 處理得了主唱加鋼琴這個主結構,但它漏掉太多關於整個空間的聲音指示,做音樂類簡報時還輪不到它。

測試三:多元素場景——夜市的火

Prompt: A Bangkok street food vendor tosses a wok over towering flame at night. Fire dynamics, six customers, a woman filming with a glowing phone screen, handheld documentary camera, and audio including burner roar, sizzling oil, Thai orders, traffic, and distant pop music.

HappyHorse 1.0 的結果。 火焰動態很驚人——火舌回應著鍋子的甩動,物理很有說服力,火星散開的軌跡也可信。甩麵的弧線和時機都對。音訊撐起了爐火的轟鳴、油的滋滋聲、車流,還有更廣的街道氛圍。不過人的表演掉鏈子:攤販和客人都在,但他們的臉沒有對熱氣、速度和人來人往做出自然的反應。

Seedance 2.0 的結果。 視覺上沒那麼炸,但整個場景讀起來更連貫。鏡頭語言很出色——手持的晃動有目的性,景深的變化引導了注意力,這支片從火焰到攤販再到人群的順序也更清楚。人的行為更可信——攤販的動作、客人的注意力和人群的反應,都比 HappyHorse 那種比較僵硬的人物表演更貼合情境。音訊的完整度不夠:基本的滋滋聲和街道環境音有,但泰語叫單的攤販聲不見了。

測試三評分表:

面向HappyHorse 1.0Seedance 2.0
畫面品質
動態流暢度
提示詞遵循度
運鏡
音訊品質
影音同步
整體可用性

判定: 這是最接近的一回合。HappyHorse 抓到更多要求的視覺和聲音元素;Seedance 把這個場景講得更好。

整體結果

面向HappyHorse 勝Seedance 勝平手
畫面品質300
動態流暢度210
提示詞遵循度211
運鏡030
音訊品質300
影音同步300
整體可用性201

意外的不是 HappyHorse 在畫面上贏——排行榜早就講過了。意外的是 HappyHorse 在音訊上也贏。加上聲音之後差距變大,而不是變小。統一架構產出的視聽體驗,比「先分開再同步」那條路更整體。

社群怎麼說

創作者串裡的風向,集中在幾個一致的主題:

  • 畫質有共識。 視覺差距很明顯;愈來愈多人提到音訊比預期更強,尤其是環境聲景和擬音。
  • 上線流程有優勢。 一講到可重現性、靠參考素材控制和被導演過的工作流,大家會點頭給 Seedance。
  • 共同的老問題。 兩個模型在精準的多角色站位上都還是會卡。
  • 看任務挑模型。 想要單次生成就最強的一支片,用 HappyHorse。需要拿參考素材去指揮輸出,用 Seedance。

社群的讀法和上面的測試結果是一致的。

音訊的落差為什麼讓我們意外

Artificial Analysis Video Arena 做的是盲測視覺比較,使用者並排比較沒有標籤的片子。無聲影片測試裡,HappyHorse 領先約 88 個 Elo 分。加上音訊之後,公開分數收斂到幾乎平手,看起來像是 Seedance 的分支架構追上來了。

但實務上——用正常速度、開著聲音看完整支片——HappyHorse 的優勢沒有縮小,反而擴大了。為什麼?因為短片的孤立 A/B 比較會放大明顯的聲音事件(一聲刀鳴、一個鋼琴音),而不是環境的整體感。而環境的整體感,正是 HappyHorse 那種統一單次生成拉開差距的地方。

什麼時候選 HappyHorse 1.0

  • 單支片的品質最重要
  • 需要沉浸式環境聲景的專案
  • 快速迭代(H100 上一支 5 秒的 1080p 片約 38 秒)
  • 創意優先的工作——情緒板、社群主打片
  • 需要多語言對嘴的講話人頭(7 種語言)

什麼時候選 Seedance 2.0

  • 要導演級的輸入控制(最多 9 張參考圖、3 段影片、3 個音訊檔)
  • 運鏡精準度和分鏡遵循度
  • 角色和道具要一致的多鏡頭序列
  • 需要穩定性和成熟文件的製作流程

HappyHorse 還是 Seedance:依情境選

情境首選為什麼
社群主打片HappyHorse單支片最強,音訊有沉浸感
有指定鏡頭的商品廣告Seedance運鏡控制加上靠參考素材維持一致
音樂錄影帶HappyHorse影音生成更整體
多鏡頭敘事序列Seedance參考系統讓鏡頭之間保持一致
概念探索/情緒板HappyHorse視覺天花板最高,生成快
需要精準對嘴的講話人頭HappyHorse七種語言的對嘴都很強
照分鏡走的製作Seedance更忠實地執行運鏡和鏡頭指示
有氛圍的電影感空景HappyHorse環境音加上視覺的戲劇性
從參考素材出發的受控場景Seedance9 張圖加 3 段影片的參考系統
快速的客戶提案HappyHorse快,而且第一格的衝擊力最強

HappyHorse 1.0 對決 Seedance 2.0:常見問題

HappyHorse 1.0 比 Seedance 2.0 好嗎?

在我們的測試裡,HappyHorse 在大多數面向都產出更強的結果——畫面品質、動態流暢度、音訊豐富度,以及整支片的可用性。Seedance 在運鏡精準度和靠參考素材被指揮的能力上勝出。

HappyHorse 1.0 會生成音訊嗎?

會。HappyHorse 在生成影片的同一次過程裡就原生生成音訊,包含七種語言(英語、國語、粵語、日語、韓語、德語、法語)的對白與對嘴、擬音和環境音。

哪個比較快?

HappyHorse 在 H100 的機器上,一支 5 秒的 1080p 片大約 38 秒。Seedance 的生成時間依平台和設定而異,但大致落在類似的區間。

HappyHorse 1.0 真的開源了嗎?

阿里巴巴已經宣布會開源權重、蒸餾模型和推論程式碼。截至 2026 年 5 月,這個模型可以透過 fal.ai、Replicate 和阿里雲的 API 使用。GitHub 或 Hugging Face 上經獨立驗證的公開權重,目前仍未獲得確認。

Seedance 2.0 的畫面品質追得上 HappyHorse 嗎?

在逐格比較裡,HappyHorse 一貫產出更銳利的質感、更有戲的光線和更流暢的動態。Seedance 的畫面很扎實,但就是低一階。

哪個處理複雜提示詞比較好?

HappyHorse 從複雜提示詞裡產出的東西更驚人,但有時候會對運鏡和空間指示做出自己的創意詮釋。Seedance 更照字面執行詳細的提示詞指示。

兩個模型都支援圖生影片嗎?

都支援。兩個都吃參考圖當輸入並據此生成影片。在公開評測上,HappyHorse 的圖生影片 Elo(約 1,392)領先 Seedance(約 1,351)。

最終判定:HappyHorse 1.0 對決 Seedance 2.0

HappyHorse 的統一架構全面產出更完整的一支片——更好的畫格、更自然的動態、更沉浸的聲景。Seedance 並不是比較弱的模型,它是另一種工具。它導演級的參考系統、可預測的運鏡執行和成熟的製作生態,讓它在你需要控制輸出、而不是被輸出驚豔的時候,成為對的選擇。

2026 年最強的工作流是兩個都用:HappyHorse 負責主打鏡頭、概念探索,還有那種要讓人滑到一半停下來的片子。Seedance 負責被指揮過的序列、對得上的剪接點,以及那條以可重現性為目的的製作流程。

想更深入了解多鏡頭生成和它的走向,可以看我們的姊妹篇 BACH AI 影片生成器

在 OmniArt 上開始

打開 OmniArt 影片工作台裡的 Happy Horse 1.0,用同一份簡報和 Seedance 比一比——同一組提示詞、同一批參考素材、並排的輸出——不用在不同帳號和不同計價方式之間切來切去。拿上面那份七面向評分表,跑你自己的製作提示詞。贏的那個模型不是 Elo 最高的那個,而是用最少次數就把你的草稿帶到「過了」的那個。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始