HappyHorse 1.0 против Seedance 2.0: чего не видит Elo
HappyHorse лидирует в рейтинге Elo для видео без звука. Три реальных промпта со звуком: результаты бок о бок, оценочные карты и руководство по выбору для креаторов OmniArt.

Примечание
Обновление (13 июля 2026 г.): Happy Horse 1.0 теперь доступен в OmniArt с генерацией видео по тексту/изображению, длительностью 3–15 с, 720p/1080p и нативным аудио.
Рейтинг Artificial Analysis ставит HappyHorse 1.0 на первое место в генерации видео по тексту без звука, а Seedance 2.0 — на второе. Это лёгкое сравнение, и оно же скучное: рейтинги без звука награждают то, что удобно сравнивать бок о бок в просмотрщике. Реальные производственные брифы идут со звуком, с ограничениями и с несколькими элементами, которые двигаются одновременно.
Мы прогнали три таких брифа через обе модели — дуэль самураев, джазовое выступление и сцену на ночном рынке Бангкока — и оценили результаты по семи измерениям, включая синхронизацию звука и общую пригодность. Разрыв в Elo не сузился. Он стал шире в пользу HappyHorse, причём там, где мы этого не ждали. Ниже — полный разбор и руководство по выбору сценарий за сценарием для тех, кто выбирает между этими моделями в OmniArt.
HappyHorse 1.0 против Seedance 2.0: краткие характеристики
| Характеристика | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| Разработчик | Alibaba (подразделение ATH AI Innovation) | ByteDance (Seed Research) |
| Запуск | 7 апреля 2026 (арена) / 27 апреля 2026 (API) | 10 февраля 2026 |
| Архитектура | Единый Transformer на self-attention, 40 слоёв (~15 млрд параметров) | Двухветочный диффузионный Transformer (DB-DiT) |
| Максимальное разрешение | 1080p | До 2K |
| Максимальная длительность | 5–15 секунд | 4–15 секунд |
| Аудио | Совместно с видео, за один проход | Совместно с видео, две ветки и cross-attention |
| Синхронизация губ | 7 языков (английский, китайский, кантонский, японский, корейский, немецкий, французский) | Мультиязычная, точность до миллисекунд |
| Референсы на входе | Текст, изображение | Текст, до 9 изображений, 3 видеоклипа, 3 аудиоклипа |
| Управление камерой | Через промпт | Режиссёрское (камера, свет, тень, игра актёра) |
| Elo: T2V без звука | ~1 357 (#1) | ~1 269 (#2) |
| Elo: T2V со звуком | ~1 210 (#2) | ~1 220 (#1 или наравне) |
| Открытый код | Объявлен; веса независимо не проверены | Закрытый код |
| Доступ по API | fal.ai, Replicate, Alibaba Cloud | Dreamina, CapCut, BytePlus Ark, fal.ai |
Разрыв в Elo на видео без звука — примерно 88 пунктов, то есть около 58 % побед HappyHorse в слепом сравнении. Это публичный бенчмарк. Интереснее другое: переживёт ли он звук, сложность и оценочные шкалы, похожие на реальные производственные требования.
Что такое HappyHorse 1.0 и Seedance 2.0 на самом деле
HappyHorse 1.0
HappyHorse обрабатывает токены текста, изображения, видео и звука в одной последовательности через 40 слоёв self-attention. Модель генерирует видео 1080p с синхронизацией губ на семи языках, эффектами Foley и фоновым звуком — всё за один единый проход.
Модель появилась анонимно на Artificial Analysis Video Arena 7 апреля 2026 года, сразу заняла верхнюю строчку и исчезла через 72 часа. Позже Alibaba подтвердила, что модель принадлежит ей, и 27 апреля открыла доступ по API.
Seedance 2.0
Seedance использует двухветочный диффузионный Transformer: одна ветка генерирует видео, отдельная ветка генерирует звук, а cross-attention связывает их с точностью до миллисекунд. Модель принимает до 9 референсных изображений, 3 видеоклипов и 3 аудиофайлов на генерацию, что даёт режиссёрский контроль над движением камеры, светом и игрой персонажа. Запуск состоялся 10 февраля 2026 года.
Примечание
Разница в двух словах: HappyHorse создаёт единое аудиовизуальное впечатление за один проход. Seedance генерирует видео и звук в отдельных ветках, а потом синхронизирует их. Этот архитектурный выбор определяет всё сравнение ниже.
Как мы тестировали
Большинство сравнительных статей повторяют одни и те же тесты с пейзажем и портретом, то есть по сути переигрывают то, что рейтинг Elo уже измерил. Мы взяли три реальных производственных сценария, придуманных так, чтобы нагрузить звук, поведение камеры и координацию нескольких элементов, — то, чего рейтинг без звука увидеть не может.
Каждый тест оценивался по семи измерениям:
- Качество картинки
- Плавность движения
- Следование промпту
- Работа камеры
- Качество звука
- Синхронизация звука и картинки
- Общая пригодность
Тест 1: кинематографическое действие — дуэль в бамбуковой роще
Промпт: A lone samurai in black lacquered armor at dawn draws a katana in a dense bamboo forest. Mist, wind sounds, blade ring, temple bells, and a camera pull from tight hand grip to wide tracking shot.
Результат HappyHorse 1.0. Картинка удалась: физически убедительные блики на доспехах, объёмное взаимодействие с туманом и вынимание клинка с реалистичным весом. Главное здесь — синхронизация звука: металлический звон клинка приходит точно вместе с движением, не раньше и не позже, а на нужных кадрах. Единая архитектура окупается — однопоточный Transformer относится к изображению и звуку как к частям одного события, и это слышно.
Результат Seedance 2.0. Детализация картинки заметно ниже: фактура доспехов мягче, туман менее объёмный. Зато выигрывает работа камеры — отъезд от крупного плана к широкому начинается ближе к заданию и выглядит спланированным, а не приблизительным. Звуку не хватает пространственного погружения HappyHorse: источники звучат близко к камере, а не распределены по сцене.
Оценочная карта теста 1:
| Измерение | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| Качество картинки | ✓ | |
| Плавность движения | ✓ | |
| Следование промпту | ✓ | |
| Работа камеры | ✓ | |
| Качество звука | ✓ | |
| Синхронизация звука и картинки | ✓ | |
| Общая пригодность | ✓ |
Вывод: HappyHorse выигрывает 6 измерений из 7. Точность камеры у Seedance реальна — модель честнее отрабатывает отъезд от крупного плана к широкому, — но это не компенсирует разрыв по звуку.
Тест 2: музыкальное выступление — последняя песня в Blue Note
Промпт: A jazz singer in crimson velvet under amber spotlight performs with piano accompaniment. Cigarette smoke, glass clinks, muffled conversation, and a slow camera push-in as the melody builds.
Результат HappyHorse 1.0. Блеск бархата выглядит реалистично, дым кажется физически смоделированным, а не нарисованным поверх. Покачивание певицы имеет естественный ритм, без роботизированных колебаний, по которым обычно узнают клипы, сделанные нейросетью. Ещё крупнее выигрыш по звуку: вокал и фортепиано звучат как одно музыкальное событие. Движения губ идут за вокальной линией без дрейфа к середине клипа, которого мы ожидали. Модель не синхронизирует два отдельных потока постфактум — она создаёт единое аудиовизуальное впечатление.
Результат Seedance 2.0. Картинка добротная, но менее атмосферная: бархат убеждает слабее, дым менее подвижен. Звук теряет полноту сцены: в клубе должны были слоями лежать звон бокалов и приглушённый гул зала, но в результате Seedance эти детали либо слишком тихие, либо отсутствуют. Камера остаётся дисциплинированной — наезд следует промпту буквальнее, чем у HappyHorse: от среднего плана к крупному, как и задано.
Оценочная карта теста 2:
| Измерение | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| Качество картинки | ✓ | |
| Плавность движения | ✓ | |
| Следование промпту | ✓ | |
| Работа камеры | ✓ | |
| Качество звука | ✓ | |
| Синхронизация звука и картинки | ✓ | |
| Общая пригодность | ✓ |
Вывод: HappyHorse выигрывает этот раунд убедительнее, чем ожидалось. Seedance справляется с основной связкой «певица и фортепиано», но теряет слишком много указаний по звуку самого зала, чтобы стать лучшим выбором для музыкального брифа.
Тест 3: сцена со множеством элементов — огонь на ночном рынке
Промпт: A Bangkok street food vendor tosses a wok over towering flame at night. Fire dynamics, six customers, a woman filming with a glowing phone screen, handheld documentary camera, and audio including burner roar, sizzling oil, Thai orders, traffic, and distant pop music.
Результат HappyHorse 1.0. Впечатляет динамика огня: пламя отзывается на бросок вока убедительной физикой, искры разлетаются по правдоподобным траекториям. Подброшенная лапша имеет верную дугу и тайминг. Звук несёт гул горелки, шипение масла, трафик и общую атмосферу улицы. А вот игра людей проседает: повар и покупатели на месте, но их лица не реагируют естественно на жар, скорость и суету вокруг.
Результат Seedance 2.0. Визуально менее взрывно, зато сцена читается связнее. Язык камеры хорош: ручное движение выглядит осмысленным, смена глубины резкости ведёт внимание, а у клипа есть внятная последовательность от пламени к повару и к толпе. Поведение людей убедительнее: движения повара, внимание покупателей и реакции толпы соответствуют ситуации лучше, чем более деревянная актёрская игра у HappyHorse. Полнота звука недотягивает: базовое шипение и уличный фон есть, но выкрикивающего заказы тайского повара нет.
Оценочная карта теста 3:
| Измерение | HappyHorse 1.0 | Seedance 2.0 |
|---|---|---|
| Качество картинки | ✓ | |
| Плавность движения | ✓ | |
| Следование промпту | ✓ | ✓ |
| Работа камеры | ✓ | |
| Качество звука | ✓ | |
| Синхронизация звука и картинки | ✓ | |
| Общая пригодность | ✓ | ✓ |
Вывод: это самый близкий раунд. HappyHorse захватывает больше запрошенных визуальных и звуковых элементов; Seedance лучше рассказывает сцену.
Итог по всем измерениям
| Измерение | Побед HappyHorse | Побед Seedance | Ничья |
|---|---|---|---|
| Качество картинки | 3 | 0 | 0 |
| Плавность движения | 2 | 1 | 0 |
| Следование промпту | 2 | 1 | 1 |
| Работа камеры | 0 | 3 | 0 |
| Качество звука | 3 | 0 | 0 |
| Синхронизация звука и картинки | 3 | 0 | 0 |
| Общая пригодность | 2 | 0 | 1 |
Удивляет не то, что HappyHorse выигрывает по картинке — об этом уже сказал рейтинг. Удивляет, что HappyHorse выигрывает и по звуку. Со звуком разрыв становится шире, а не уже. Единая архитектура даёт более цельное аудиовизуальное впечатление, чем подход «сначала раздельно, потом синхронизировать».
Что говорит сообщество
Настроения в тредах креаторов складываются вокруг нескольких устойчивых тем:
- Согласие по качеству. Разрыв по картинке очевиден; всё чаще пользователи отмечают, что звук оказался сильнее ожиданий, особенно фоновые звуковые пейзажи и Foley.
- Преимущество в продакшне. Когда разговор заходит о повторяемости, управлении через референсы и режиссированных процессах, предпочтение отдают Seedance.
- Устойчивые ограничения. Обе модели по-прежнему плохо справляются с точным размещением нескольких персонажей.
- Выбор под задачу. Берите HappyHorse, когда нужен самый сильный клип с одной генерации. Берите Seedance, когда результат нужно вести референсами.
Эта оценка сообщества совпадает с результатами тестов выше.
Почему разрыв по звуку удивляет
Artificial Analysis Video Arena проводит слепые визуальные тесты, где пользователи сравнивают неподписанные клипы бок о бок. На видео без звука HappyHorse лидирует примерно на 88 пунктов Elo. Со звуком публичные оценки сходятся почти к паритету, из чего можно было бы заключить, что раздельная архитектура Seedance догоняет.
На практике — при просмотре целых клипов на обычной скорости со звуком — преимущество HappyHorse не сократилось. Оно выросло. Почему? Изолированное A/B-сравнение коротких клипов подчёркивает заметные звуковые события (звон клинка, ноту фортепиано), а не связность фона. Связность фона — как раз то, где единая генерация HappyHorse за один проход уходит вперёд.
Когда выбирать HappyHorse 1.0
- Когда решает качество одного клипа
- Для проектов, которым нужен погружающий фоновый звук
- Для быстрых итераций (пятисекундный клип 1080p примерно за 38 с на H100)
- Для работы, где первично творчество, — мудборды, главные ролики для соцсетей
- Для говорящей головы с мультиязычной синхронизацией губ (7 языков)
Когда выбирать Seedance 2.0
- Режиссёрский контроль входных данных (до 9 референсных изображений, 3 клипов, 3 аудиофайлов)
- Точность камеры и следование раскадровке
- Последовательности из нескольких планов с консистентными персонажами и предметами
- Производственные конвейеры, которым нужны стабильность и зрелая документация
HappyHorse или Seedance: выбор по сценарию
| Сценарий | Первый выбор | Почему |
|---|---|---|
| Главный ролик для соцсетей | HappyHorse | Самый сильный одиночный клип с погружающим звуком |
| Реклама продукта с конкретными планами | Seedance | Контроль камеры и консистентность по референсам |
| Музыкальный клип | HappyHorse | Более цельная аудиовизуальная генерация |
| Нарративная сцена из нескольких планов | Seedance | Система референсов удерживает планы согласованными |
| Проработка концепта и мудборд | HappyHorse | Самый высокий визуальный потолок и быстрая генерация |
| Говорящая голова с точной синхронизацией губ | HappyHorse | Сильная синхронизация губ на 7 языках |
| Продакшн по раскадровке | Seedance | Точнее следует указаниям по камере и планам |
| Кинематографический B-roll с атмосферой | HappyHorse | Звук среды плюс визуальная драматургия |
| Режиссированная сцена по референсам | Seedance | Система референсов на 9 изображений и 3 видео |
| Быстрая презентация клиенту | HappyHorse | Быстро, максимальный эффект первого кадра |
HappyHorse 1.0 против Seedance 2.0: FAQ
HappyHorse 1.0 лучше, чем Seedance 2.0?
В наших тестах HappyHorse дал более сильный результат по большинству измерений — качество картинки, плавность движения, богатство звука и общая пригодность клипа. Seedance оказался лучше в точности камеры и в управляемости через референсы.
Умеет ли HappyHorse 1.0 генерировать звук?
Да. HappyHorse генерирует звук нативно, в том же проходе, что и видео: реплики с синхронизацией губ на семи языках (английский, китайский, кантонский, японский, корейский, немецкий, французский), эффекты Foley и фоновый звук.
Какая модель быстрее?
HappyHorse генерирует пятисекундный клип 1080p примерно за 38 с на инфраструктуре H100. Время генерации у Seedance зависит от платформы и настроек, но в целом находится в сопоставимом диапазоне.
У HappyHorse 1.0 действительно открытый код?
Alibaba объявила об открытой публикации весов, дистиллированных моделей и кода для запуска. По состоянию на май 2026 года модель доступна через API fal.ai, Replicate и Alibaba Cloud. Независимо проверенных публичных весов на GitHub или Hugging Face пока нет.
Может ли Seedance 2.0 сравняться с HappyHorse по качеству картинки?
При покадровом сравнении HappyHorse стабильно даёт более чёткие фактуры, более драматичный свет и более плавное движение. Картинка Seedance добротная, но на шаг ниже.
Какая модель лучше справляется со сложными промптами?
HappyHorse выдаёт более эффектный результат на сложных промптах, но иногда позволяет себе вольности с указаниями по камере и пространству. Seedance следует подробным инструкциям буквальнее.
Поддерживают ли обе модели генерацию видео из изображения?
Да. Обе принимают референсное изображение на вход и генерируют из него видео. В публичном бенчмарке Elo для image-to-video HappyHorse (~1 392) опережает Seedance (~1 351).
Итоговый вердикт: HappyHorse 1.0 против Seedance 2.0
Единая архитектура HappyHorse даёт более полный клип по всем статьям: лучше кадры, естественнее движение, глубже звуковая среда. Seedance не слабее — это инструмент другого рода. Режиссёрская система референсов, предсказуемая работа камеры и зрелая продакшн-экосистема делают его правильным выбором, когда результатом нужно управлять, а не восхищаться.
Сильнейший подход в 2026 году использует обе модели: HappyHorse — для главных кадров, проработки концептов и клипов, которые должны остановить зрителя на пролистывании. Seedance — для режиссированных последовательностей, стыкующихся склеек и конвейера, где смысл именно в повторяемости.
Более глубокий разбор генерации из нескольких планов и того, куда она движется, — в нашем парном материале про BACH AI video generator.
С чего начать в OmniArt
Откройте Happy Horse 1.0 в видеопространстве OmniArt, чтобы сравнить его с Seedance на одном брифе — один промпт, одни и те же референсные материалы, результаты рядом — без жонглирования отдельными аккаунтами и тарифами. Прогоните оценочную карту из семи измерений выше на своих продакшн-промптах. Побеждает не модель с наибольшим Elo, а та, что доводит черновик до «принято» за меньшее число дублей.
Готовы создавать?
Начните генерировать впечатляющий контент с ИИ