Guide模型與觀察閱讀時間 11 分鐘

HappyHorse 1.0:AI 影片的提示詞指南與六種用法

一份實用的 HappyHorse 1.0 指南——文字、圖片、影片、音訊統一的 Transformer,帶原生音訊、8 步推論和六語言對嘴。內含六種用法。

OmniArt 團隊
HappyHorse 1.0:AI 影片的提示詞指南與六種用法

HappyHorse 1.0 是一個 150 億參數的單一 Transformer,把文字、圖片、影片和音訊的 token 放在同一個序列裡一起去噪。實際的效果是:這個模型在 H100 上大約 38 秒就能生成帶原生同步音訊的 1080p 影片——比同級模型快三到六倍,而且沒有犧牲觀感品質。它還用同一組權重支援六種語言的對嘴。這份指南談的是能吃到這個架構紅利的提示詞寫法,以及六個能看出這個模型到底是拿來做什麼的用法。

HappyHorse 1.0 是什麼

HappyHorse 1.0 是一個統一的自注意力 Transformer,40 層排成三明治結構:每個模態各有四層進出層,中間 32 層共用。每個注意力頭的 sigmoid 閘控讓多模態訓練保持穩定。它沒有獨立的音訊子模組——音訊 token 和影片 token 活在同一個序列裡,一起去噪。

規格數值
參數量約 150 億
解析度最高 1080p
時長3–15 秒(預設 5 秒)
畫面比例16:9、9:16、1:1、4:3、3:4
推論時間H100 上 1080p 約 38 秒
推論步數8 步(DMD-2 蒸餾,不用 CFG)
原生音訊有(對白、擬音、環境音一起生成)
對嘴語言6 種(英語、國語、日語、韓語、德語、法語)
輸入文字、圖片

統一架構為什麼重要

多數競爭對手的影片模型把音訊當成第二階段外掛上去:先算影片,再合成音軌,然後試著對上。HappyHorse 在同一次去噪過程裡把兩者一起生成。這就是為什麼對白會貼在嘴上、擬音會落在接觸的那一刻,而環境音層在一支片的剪接之間也保持連貫。

8 步的 DMD-2 蒸餾是故事的另一半。多數旗艦影片模型要跑 25–50 步去噪,還要加上 classifier-free guidance。HappyHorse 兩個都砍掉——8 步、不用 CFG——用一點點餘裕換到 3–6 倍的加速。對需要大量迭代的工作流來說,這是一小時三個草稿和一小時十二個草稿的差別。

提示詞工程框架

四個習慣就吃下了大部分的品質提升。它們可以轉移到其他懂音訊的影片模型上,但 HappyHorse 給的回報比多數模型更明顯。

先想音訊

把音訊當成簡報裡的第一級元素,不是事後才補的東西。下面這組對照讀起來差別很小,看起來差別很大。

沒有音訊指示有音訊指示
"Street food vendor frying noodles in a Bangkok night market.""Street food vendor frying noodles in a Bangkok night market — oil sizzling in the wok, spatula scraping metal, plate clatter, distant motorbike, customer chatter in Thai."

用具體的鏡頭語言

這個模型是有意圖地在解析攝影術語。那就用它們。

  • "Slow push-in"——逐步推近,堆疊張力
  • "Tracking shot"——橫向或跟在主體後方的跟拍
  • "Low-angle"——帶出力量和尺度的視角
  • "Macro close-up"——極致細節、淺景深
  • "360-degree orbit"——繞主體轉一整圈
  • "Aerial / drone shot"——帶前進運動的鳥瞰
  • "Whip pan"——快速橫甩

音訊分三層鋪

音訊描述成前景、中景和背景時效果最好——就像混音師處理一場戲的方式。

  • 前景: 主導的聲音(對白、主要音效)
  • 中景: 次要的聲音(腳步、衣物摩擦、碰撞聲)
  • 背景: 環境質地(人群、雨、車流、風)

把視覺風格錨住

兩到三個風格詞比五個更精準。幾組穩定生效的:

  • 照片寫實——"anamorphic bokeh, 35mm film grain, teal-orange grading"
  • 動漫/風格化——"cel-shading, thick outlines, flat bold colors"
  • 復古——"1990s VHS grain, oversaturated warm tones, CRT scan lines"
  • 商業——"studio lighting, white cyclorama, macro lens"

七個核心訣竅

  1. 把主體和動作放進前十五個字。
  2. 明確描述音訊;對白放進引號裡。
  3. 用具體的運鏡指示,不要用籠統的動詞。
  4. 用電影、色盤或傳統來指名視覺風格。
  5. 加入實體細節——雨打在玻璃上、絲綢吃到風、油在鐵板上。
  6. 提示詞控制在 100 字以內。
  7. 先用低解析度測試,再去生 1080p。

六個實測過的用法

六份簡報,分別操練模型的不同部位。每一份都是這個架構真的擅長的那種工作。

1. 帶 ASMR 級原生聲音的短影音

為那些以前要在後製疊音軌的 TikTok 和 Reels 創作者做的。

"Thai street food vendor flipping pad see ew on a flat-top griddle, close-up of wok with garlic and chilis, oil sizzles loud, spatula scrapes metal, neon signage above, warm tungsten lighting, handheld camera with subtle shake, light rain on plastic awning in the background, customer chatter in Thai mid-distance. 9:16."

2. 帶電影級精準音效的行銷素材

商品揭曉,運鏡尊重物件,聲音落在動作上。

"Luxury chronograph watch on a polished volcanic stone, slow-motion water droplets bead and roll across the dial, slow 360-degree orbit camera, soft mechanical click as the crown is pressed, deep ambient hum, studio lighting on a black background, anamorphic flare from upper left, 16:9."

3. 一次生成做出多語言廣告

對嘴是從同一組權重跑出來的。同一顆鏡頭,六種語言。

"A barista in a specialty coffee shop slides a flat white across a wooden counter and says, in casual Mandarin, '今天的豆子很特别,慢慢喝。' Espresso machine hisses, cup slides on wood, indie film aesthetic, soft window light from behind, shallow depth of field, 16:9."

4. 帶分層環境音的空景與前期視覺

環境音和畫面出一樣多力的開場鏡頭。

"Wide shot of a figure in a red parka approaching a glowing Antarctic research station at twilight, slow forward tracking, the camera then pulls back into a wide aerial, howling wind continuous, boots crunching frozen snow, faint radio crackle from inside the station, atmospheric ambient pad, cool blue palette, 21:9."

5. 從一張靜態圖做出電商商品動態

圖生影片的簡報,讓主圖動起來又不掉材質。

"White running shoes on a charcoal pedestal, slow 360-degree orbit revealing tread, mesh, and neon accents, fine dust particles drift through a key light beam, soft whoosh as the shoe rotates, faint rubber creak, soft landing thud at the end of the rotation, soft studio lighting, 1:1."

6. 給 AI 研究用的多模態壓力測試

一場針對影音聯合序列的即興測試。

"Three-piece jazz ensemble in a dim club: drums brushed lightly, walking double bass, saxophone solo. The audience taps a glass on the table in rhythm. Smoke drifts through a single overhead spotlight, vintage 16mm film grain, warm amber tungsten, slow lateral tracking from drums to saxophonist, 16:9."

它跟別人比起來如何

HappyHorse 在 2026 年這份影片模型名單裡的位置。

對上HappyHorse 的優勢對方的優勢
Seedance 2.08 步推論、聯合音訊、六語言對嘴、體積更小多參考系統(最多 12 份素材)、2K、原生多鏡頭
Kling 3.0有開源路線、推論更快、原生音訊4K 解析度、對嘴語言覆蓋已經成熟
Veo 3統一架構、快 3–6 倍空間音訊、原生 4K、Google 生態系
Wan 2.2一次生成就有原生聯合音訊現在就開源;HappyHorse 的權重還沒公開釋出

誠實的限制

在把交期押在 HappyHorse 上之前,有三件事要知道。

  • 撰稿當下,權重和推論程式碼都還沒公開。 儲存庫在 github.com/FreeyW/HappyHorse,但可以跑的那份程式碼樹還不在上面。在那之前請用 OmniArt 上的 Happy Horse 1.0,或阿里巴巴的 Dashscope API。
  • 每支片上限 15 秒。 沒有原生的多鏡頭時間軸;要做更長的敘事,就用另一個模型的延長模式接下去。
  • 沒有多模態參考系統。 只吃文字和圖片。如果你需要用影片或音訊當條件參考,就用 Seedance 2.0。

說明

DMD-2 蒸餾版不用 classifier-free guidance,這正是 8 步推論路徑能成立的原因。它是多數上線工作的正確預設;只有在你需要最高的觀感品質、而且有時間跑更長的去噪迴圈時,才去動基礎模型。

在 OmniArt 上開始

Happy Horse 1.0 就在 OmniArt 的影片工作台裡,和 Seedance 2.0、Kling、Veo 3、Sora 2 與 V6 放在一起。一個帳號、一份點數餘額、模型可以並排評估。先從上面那份社群 ASMR 簡報開始,感受一下音訊優先的流程,等你想測圖生影片,再換到電商商品那一份。

如果你正在 HappyHorse 和 Seedance 2.0 之間猶豫,HappyHorse 1 對決 Seedance 2 的比較一顆鏡頭一顆鏡頭走過所有取捨。要做比較長的敘事作品,BACH 攝影指導指南是更好的起點。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始