IndustryМоделі та аналітика12 хв читання

Seedance 2.5: що вийшло і що змінилося порівняно з 2.0

Seedance 2.5 працює в OmniArt: генерації по 30 секунд, продовження до 60 секунд, довге відео на 180 секунд, 50 референсів і таймкоди з точністю до секунди.

Команда OmniArt
Seedance 2.5: що вийшло і що змінилося порівняно з 2.0

Seedance 2.5 можна вибрати у відеопросторі OmniArt, і це більший реліз, ніж підказує номер версії. Seedance 2.0 заклала мультимодальну передумову — зображення, відео, аудіо й текст, що живлять один промпт. Seedance 2.5 зберігає цю передумову й перебудовує дві речі, які обмежували її на практиці: скільки може тривати одна генерація і скільки референсних матеріалів модель насправді враховує.

Це огляд можливостей, а не посібник із промптів: що нового, які реальні стелі й де в релізі досі є шорсткості. Раніше ми писали про анонс за передрелізною інформацією в попередньому огляді релізу Seedance 2.5; кілька тих цифр змінилися на момент виходу моделі, і саме числа щодо роздільної здатності нижче є чинними.

Примітка

Кожна специфікація нижче взята з офіційної документації Dreamina про запуск і використання Seedance 2.5. Там, де вона розрізняє жорсткий ліміт і рекомендований діапазон, так само робить і ця стаття — ця різниця важливіша за число із заголовка.

Seedance 2.5 проти Seedance 2.0 коротко

МожливістьSeedance 2.0Seedance 2.5
Тривалість однієї генерації4–15 секунд (97–361 кадр)4–30 секунд (97–721 кадр)
Зображень на запит0–9До 30
Продовження відеоНедоступнеПродовжує будь-який результат до 30 секунд, і так повторно, до 60 секунд загалом
Довге відеоНедоступнеГенерація 30–180 секунд за один прохід
Керування таймкодамиНедоступнеНативне, з точністю до секунди
Режими генераціїOmni Reference, Smart Edit, Long Video, First and Last Frames
Роздільна здатність виводу480p, 720p

Два з чотирьох режимів — нові. Smart Edit і Long Video у 2.0 не існували. Smart Edit також має оновлену поверхню під назвою Edit with marks: вона дає розмічати вивантажене відео рамками, пензлем, стрілками, текстом і опорними точками, а варіант Edit Video переносить той самий процес розмітки на ролики вже після генерації.

Три різні способи вийти за 15 секунд

Найважливіша зміна в тому, що на питання «скільки це може тривати» тепер є три окремі відповіді, і хибний вибір коштує однієї генерації.

Одна генерація: від 4 до 30 секунд

Базовий діапазон подвоюється. Один промпт тепер купує до 30 секунд, або 721 кадр, проти 15 секунд і 361 кадру у 2.0. Документація стверджує, що просторово-часова та міжкадрова узгодженість тримається на всьому 30-секундному вікні — зовнішність персонажа, просторова логіка й переходи між планами мають пережити довший прохід, а не пливти в другій половині.

Продовження відео: принцип матрьошки до 60 секунд

Будь-який результат тривалістю до 30 секунд можна продовжити новим промптом, а результат цього продовження — продовжити ще раз. Документація називає це складанням за принципом матрьошки, і накопичена стеля становить 60 секунд.

Цікаве тут не загальна сума. Цікаве те, що кожен вузол продовження приймає нову режисуру — у документації це називають посегментним керуванням режисера. Ви можете згенерувати десять секунд бігу персонажа, підтвердити їх, а вже потім задати стрибок у наступному продовженні, замість ставити всю дію на одну подачу. Для постановки бійки чи сюжетного повороту, який має влучити в конкретний момент, це інший метод роботи, ніж написання довшого промпта.

Продовження працюють уперед і назад, а документація радить для продовження цілого плану явні обмеження неперервності: природне продовження, плавне сполучення руху, без різкого обрізання плану, без появи об’єктів нізвідки. Ми розбираємо цей процес у посібнику з редагування та продовження в Seedance 2.5.

Long Video: від 30 до 180 секунд за один прохід

Long Video — це окремий режим, а не довше налаштування стандартного. Він генерує від 30 до 180 секунд напряму, без склейки й без ланцюжка продовжень. Заявлені цілі дизайну — узгодженість рис персонажа, деталей одягу та архітектури сцени на всій довжині у три хвилини, плюс плавні тривалі рухи камери: повільні наїзди, оберти й проходи, які тримаються на довгому дублі.

Оскільки трихвилинна генерація дорого коштує, якщо вийшла невдало, формула промпта для довгого відео в документації починається з глобальних параметрів — повторіть тривалість і співвідношення сторін на початку промпта, навіть якщо ви вже задали їх в інтерфейсі.

Бюджет референсів: 50 матеріалів і як їх витратити

Seedance 2.5 приймає до 50 референсних вхідних матеріалів в одному запиті. Ця стеля ділиться на три частини, і кожен тип має жорсткий ліміт і окремий рекомендований діапазон.

ТипЖорсткий лімітРекомендований діапазон
ЗображенняДо 30, кожне 4K або менше1–8 різних об’єктів; 9–12 можливо, але стабільність падає
ВідеоДо 10, сумарно 30 секунд1–5 різних об’єктів, 5–10 секунд на відео з об’єктом; 6–10 об’єктів можливо, але стабільність падає
АудіоДо 10, сумарно 30 секундЛише той діалог, голос, ембієнт чи музика, які кадру справді потрібні
Редагування відеоОдне вихідне відео плюс референсні зображенняВихідне відео до 20 секунд, 1–5 референсних зображень; 6–8 можливо

Уся суть — у розриві між двома колонками. Тридцять зображень — це те, що приймає запит; вісім об’єктів — це те, що модель надійно опрацьовує. Заповнити бюджет — не стратегія: документація прямо каже, що творчість із багатьма референсами полягає у виборі правильних матеріалів для кожної сцени, а не в тому, щоб усі матеріали з’явилися одночасно.

Одне практичне правило варто засвоїти: якщо понад п’яти об’єктам потрібні ще й кілька ракурсів, кладіть кожен ракурс в окреме зображення. Незалежні зображення на кожен ракурс стабільніші за один аркуш-колаж.

Щодо гігієни вхідних даних: зображення можуть бути jpeg, png, webp, bmp, tiff, gif, heic або heif, зі співвідношенням сторін від 0,4 до 2,5, розмірами від 300 до 6000 px, до 30 МБ кожне, а тіло запиту — до 64 МБ. Референсні відео приймаються у mp4 або mov від 480p до 4K у тих самих межах співвідношення й розмірів.

Про порядок і призначення ролей у наборах референсів читайте в посібнику з референсних промптів для Seedance 2.5.

Керування таймкодами з точністю до секунди

Seedance 2.5 нативно підтримує керування сюжетом та інтервалами планів за таймкодом. Ви пишете маркер на кшталт [00.0-05] перед планом, реплікою чи дією, а решту сценарію викладаєте в хронологічному порядку. Діапазони мають бути послідовними й не перекриватися.

Чесне формулювання з документації: діапазон таймкоду — це бюджет часу для події, а не монтажна точка з точністю до кадру. Дії можуть відбутися трохи раніше або пізніше за межу. Замало вмісту в діапазоні — і модель отримує свободу, якої ви можете й не хотіти; забагато — і виникає надмірна нарізка чи випадання подій. Вимагати частоти на кшталт трьох окремих дій в одну секунду не вийде.

Якщо користуватися правильно, це все одно найбільший важіль впливу на ритм. Саме він змушує 30-секундну генерацію з кількома планами поводитися як сценарій, а не як монтажна нарізка, і саме він є хребтом підходу в посібнику з 30-секундних промптів для Seedance.

Багатомовний вхід і діалоги

Seedance 2.5 приймає текстовий вхід багатьма мовами, з двома задокументованими рівнями. Найвищий пріоритет оптимізації охоплює китайську, англійську, іспанську, індонезійську та малайську. Повне покриття поширюється на тайську, арабську, португальську, в’єтнамську, японську та корейську.

Реліз також цілиться в точність вимови, менше помилок у рідкісних словах і кращу синхронізацію губ із багатомовним мовленням. Для тих, хто робить локалізовані варіанти реклами чи короткометражку, де персонажі говорять різними мовами, саме це поєднання — бриф вашою мовою, репліки цільовою, артикуляція, що збігається — і є практичним відкриттям.

Робота над якістю базової моделі

Не все у 2.5 — це нова кнопка. Помітна частина релізу — це перебудова базової моделі, спрямована на те, що документація називає прибиранням «ШІ-присмаку»:

  • Шкіра — менше пластикового полиску й масних відблисків, повернено справжні пори й реакцію на світло.
  • Шерсть тварин — пухнастіша й краще розділена замість злиплої.
  • Голос — менше механічного тембру синтезу мовлення в згенерованих репліках.
  • Рідкісний рух — незвичні танці, складні бойові мистецтва й тонкі зміни виразу обличчя тепер генеруються плавно, а не спотворюються.
  • Узгодженість — просторово-часова логіка та неперервність персонажа між склейками тримаються протягом повної 30-секундної генерації.

Важелі з боку промпта дрібні й конкретні: фрази на кшталт native skin texture і hair root distinct для реалістичності, а також сталі описи персонажа, повторені в кожному плані, щоб тримати узгодженість крізь склейки.

Без субтитрів і без фонової музики — тепер справді враховується

Це маленьке виправлення з непропорційно великим ефектом для продакшену. Попередні версії могли вшити субтитри чи додати фонову музику навіть тоді, коли промпт просив цього не робити. Seedance 2.5 виконує ці інструкції, а задокументоване формулювання — це модифікатор на кшталт "pure video, no subtitles, no background music".

Якщо ви віддаєте монтажеру чи звукорежисеру чисті вихідні матеріали, це різниця між придатним результатом і таким, який доведеться генерувати заново.

Оновлення мультимодальних референсів

Найбільший окремий блок у нотатках релізу — це група можливостей із боку референсів. Разом вони штовхають Seedance від генератора до чогось ближчого до керованої монтажної поверхні:

  • Відокремлення фонової музики — прибрати музику, зберігши голос, і, що важливо, зберігши недоторканими субтитри на екрані та інші візуальні елементи.
  • Перенесення ідеї та мови камери — перенести з референсу траєкторію наїзду, від’їзду чи панорами, тремтіння камери з рук, логіку кольору та емоційну атмосферу, а не лише поверхневий рух тіла.
  • Часткове вилучення та редагування — виділити ділянку пензлем або рамкою для безслідного стирання, з добудовою тла за фізичною та світловою логікою, а також спрямована заміна елементів.
  • Зміна просторової перспективи — змінити ракурс уже готового плану на вигляд згори, з нижнього ракурсу чи від першої особи, зберігши пропорції й узгоджену побудову.
  • Референс тембру — відтворити тембр разом з емоційним напруженням і ритмом еталонного запису.
  • Референс із кількома людьми — без змішування рис обличчя між персонажами, без обміну одягом, з коректним фізичним перекриттям під час взаємодії.
  • Зелений екран — високоточна сегментація переднього плану зі стабільністю на рівні кадру навіть на динамічному тлі.
  • Clay Renderer — плагін для Maya й Blender із чорновою розкладкою та білою моделлю, що відновлює мову камери, фіксує простір і композицію та керує позицією персонажа й траєкторією руху.
  • Безшовний перехід — згенерувати місток між двома незалежними роликами, не змінюючи жодного з джерел, за допомогою переходів на фокусній відстані, обертанні чи пірнанні, запущених дією, поглядом або перекриттям.
  • Сторіборд-сітка — подати зображення сторіборду з кількох панелей як референс сюжету.

Дві з цих можливостей мають примітки щодо використання, які варто повторити. Clay Renderer наразі дає кращі результати з грубих чорнових розкладок — простих сфер, циліндрів і кубів, що задають динамічний скелет, — ніж із детально змодельованих. Сіткові сторіборди найкраще працюють як проста контурна графіка чи схематичні фігурки, бажано не більше ніж 15 панелей, із мінімумом текстових підписів. Обидві розібрано в посібнику зі сторібордів і чорнових розкладок для Seedance 2.5.

Параметри, які фіксуються самі

Seedance 2.5 ділить роботу з матеріалами на зафіксовані й незафіксовані завдання. У зафіксованому завданні вхідний матеріал стає частиною вихідного таймлайну, і результат підлаштовується під нього. У незафіксованому матеріали дають смисловий орієнтир, а ви зберігаєте контроль над тривалістю та співвідношенням сторін виводу.

Три типи завдань перекривають налаштування, якими ви очікували керувати. Знання про це до подачі економить одну змарновану генерацію.

Тип завданняСпіввідношення сторінТривалість
Редагування відеоЗберігає співвідношення вхідного відео; окремо задати не можнаЗберігає приблизно вхідну тривалість; окремо задати не можна, а обробка вхідних кадрів може зсунути її приблизно на 0,3 секунди
Перший кадр / перший і останній кадриБере співвідношення першого зображенняМожна задати
Продовження відеоЗберігає співвідношення вхідного відео; окремо задати не можнаМожна задати

Правило першого й останнього кадру діє, коли зображення надсилаються з content.role = first_frame і content.role = last_frame. Оскільки співвідношення береться суворо з першого кадру, останнє зображення з іншим співвідношенням розтягнеться. Зрівняйте їх до вивантаження.

Генерація за референсами, сітки сторіборду й незалежні референси ключових кадрів є незафіксованими. Вони не успадковують ані співвідношення сторін матеріалу, ані його тривалість. Є також м’якший прийом із першим і останнім кадром: надішліть зображення як reference_image і назвіть їх у промпті першим та останнім кадрами. Це лишає налаштування виводу вільними, але згенеровані межові кадри лише наближаються до референсів, а не збігаються з ними строго.

Обмеження, які варто закласти в план

Роздільна здатність виводу — 480p і 720p. Це стеля релізу, і саме це обмеження найімовірніше вплине на рішення про здачу роботи: трихвилинна генерація в 720p — це зовсім інший матеріал, ніж трихвилинний мастер. Плануйте Seedance 2.5 під превіз, доставку в соцмережі й референсні матеріали відповідно і перевіряйте вимоги до здачі, перш ніж запускати довгу генерацію.

Документація також відверта щодо кількох поведінкових обмежень:

  • Таймкоди розподіляють час між подіями; це не монтажні точки з точністю до кадру.
  • Промпти для редагування підвищують імовірність, що критичні події збігаються з джерелом. Гарантувати покадрове накладання вони не можуть.
  • Вивід редагування відео може відрізнятися від входу приблизно на 0,3 секунди.
  • Продовжені сегменти можуть трохи відрізнятися гучністю від вихідного ролика.
  • Безшовні переходи цілять у візуальну та звукову неперервність, а не в піксельно ідентичну склейку.
  • Межові кадри в продовженні сполучаються природно на візуальному рівні, але не є піксельно ідентичними.
  • Для субтитрів, формул, вивісок, характеристик товару чи покадрового тайминга, які мають бути точними, поєднуйте підготовлені референси, генерацію й постпродакшн.

Жодне з цього не є вироком. Це різниця між ставленням до Seedance 2.5 як до керованого генератора всередині конвеєра і ставленням до неї як до інструмента фінішної обробки, яким вона не є.

Як почати в OmniArt

Відкрийте відеопростір OmniArt, виберіть Seedance 2.5 і пройдіть реліз у тому порядку, який справді нарощує навичку:

  1. Почніть з однієї 30-секундної генерації з таймкодами. Напишіть три-чотири послідовні діапазони без перекриттів і подивіться, наскільки точно лягає ритм. Це навчить вас поведінки моделі в часі швидше за будь-що інше.
  2. Далі перевірте продовження. Згенеруйте десять секунд, якими ви задоволені, продовжте їх новою інструкцією, а тоді продовжте й цей результат. Стежте за швом і гучністю на кожній межі.
  3. Зберіть набір референсів у рекомендованому діапазоні, а не за жорстким лімітом — кілька зображень об’єктів, кожне з однією зрозумілою роллю, і коротке референсне відео, якщо вам потрібна мова камери.
  4. Приберігайте Long Video для брифів, які ви вже перевірили на коротших тривалостях. Три хвилини — забагато, щоб довіряти їх неперевіреному промпту.
  5. Додавайте "pure video, no subtitles, no background music" до всього, що йде монтажеру.

Базову філософію промптів, яка діє в будь-якій версії Seedance, шукайте в матеріалі як писати промпти для Seedance. Тоді беріть посібник під своє завдання: референсні промпти, 30-секундні промпти, редагування та продовження або сторіборди й чорнові розкладки.

Готові творити?

Почніть створювати вражаючий контент зі ШІ

Почати безкоштовно