TipsСтатті та поради10 хв читання

7 правок промпту, коли ШІ-відео вийшло не таким

Діагностика ШІ-відео за симптомами: сім правок промпту для спотворених облич, проігнорованої дії, дрейфу сцени, нерозбірливого тексту, тремтіння й розсинхрону губ.

Команда OmniArt
7 правок промпту, коли ШІ-відео вийшло не таким

Більшість невдалих ШІ-кліпів — не проблема моделі. Це промпт з однією конкретною вадою, і ця вада залишає відбиток: руки, що розтікаються, персонаж, який стоїть на місці, камера, яка так і не зрушила, куртка, що на середині змінює колір. Щойно ви навчитеся читати цей відбиток, кожна з наведених нижче правок промпту забирає одне редагування.

Ця стаття побудована за симптомами, а не за принципами. Якщо вам потрібні основи — суб’єкт, стиль, світло, композиція, — почніть із матеріалу як писати кращі промпти і поверніться сюди, коли конкретна генерація поводитиметься дивно. Усе, що нижче, припускає, що ви вже пишете притомні промпти й хочете знати, яке саме слово змінити, коли кліп не вдався.

Приклади спираються на моделі, доступні в просторі OmniArt для відео, — Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 і C1, — бо частина налагодження полягає в тому, щоб розпізнати, коли симптом краще лікується іншою моделлю, а не додатковим текстом промпту.

Змінюйте по одній змінній за раз

Перед окремими правками візьміть за звичку те, що прискорює їх усі: одна зміна на одну генерацію. Переписувати весь промпт після невдалого дубля марно, бо ви не побачите, яке саме редагування допомогло.

Тривалість, роздільна здатність, співвідношення сторін і референсні зображення впливають на результат не менше за формулювання, тож занотовуйте налаштування поруч із текстом промпту. Два-три свідомі проходи зазвичай кращі за десять переписувань.

Порада

Спершу вкоротіть кліп. Значна частина проблем із рухом і анатомією зникає, коли ви просите чотири секунди однієї дії замість восьми секунд трьох дій.

Правка 1: обличчя, руки та кінцівки спотворюються на середині кліпу

Що ви бачите: перший кадр чистий, а далі пальці зростаються, обличчя сповзає з черепа або під час повороту з’являється зайва рука.

Чому так стається: модель інтерполює тіло через положення, яких ваш промпт ніколи не описував. Швидкий рух кінцівок, тісна крупність на руках, перекриття (рука проходить перед обличчям) і велика тривалість — усе це множить кількість кадрів, які моделі доводиться вигадувати.

Правка: зменште те, що треба вигадувати. Відсуньте крупність на один щабель, назвіть механіку тіла явно й тримайте руки або нерухомими, або на простій траєкторії. Старт із чистого зображення замість тексту теж закріплює анатомію, бо модель успадковує правильне тіло, а не вгадує його.

Було: "Close-up of a chef's hands quickly chopping vegetables and tossing them into a pan."

Стало: "Medium shot of a chef at a wooden counter. One steady chopping motion with the right hand, left hand resting flat on the board. Hands stay inside frame, no cuts. 50mm, soft window light from camera left."

Для кадрів із людьми Veo 3.1 і Kling зазвичай добре тримають будову тіла впродовж повного дубля, а «зображення у відео» на будь-якій моделі виграє в «тексту у відео», коли збій саме в анатомії. Якщо крупний план обов’язковий, укоротіть кліп і погодьтеся на один рух замість двох.

Правка 2: суб’єкт ігнорує дію, яку ви замовили

Що ви бачите: крупність, світло й стиль збігаються з промптом, але суб’єкт просто стоїть і дихає або виконує якийсь загальний холостий рух замість дії, яку ви вказали.

Чому так стається: дія похована. Якщо дієслово стоїть у кінці довгого описового речення або конкурує з трьома іншими дієсловами, модель сприймає його як ще одну ознаку нерухомої сцени. Розмиті дієслова («взаємодіє», «насолоджується», «досліджує») взагалі не мають візуальної форми, тож не відбувається нічого.

Правка: поставте суб’єкта й дію першими, візьміть одне конкретне фізичне дієслово в теперішньому часі й опишіть точку завершення дії. Усю стилістику — оптику, палітру, настрій — перенесіть після дії, щоб вона читалася як оздоблення, а не як головне речення.

Було: "A dramatic, moody, rain-soaked alley at night with neon reflections and steam, where a courier is exploring the area and interacting with her surroundings."

Стало: "A courier crouches and picks up a dropped envelope, then stands and looks left. Rain-soaked alley at night, neon reflections on wet asphalt, steam from a vent. Handheld medium shot."

Seedance добре реагує на таке формулювання в дусі кадропланів, а PixVerse C1 — притомний вибір, коли бриф зводиться до одного контрольованого руху: поворот, простягнута рука чи показ товару.

Правка 3: рух камери не відбувається або конфліктує із суб’єктом

Що ви бачите: ви просили наїзд, а отримали зафіксований кадр. Або камера рухається, але суб’єкт дивно ковзає відносно фону, і кадр справляє враження викривленої фотографії, а не руху крізь простір.

Чому так стається: причини дві, і виглядають вони схоже. Або рух заявлено як ефект без мотивації («zoom in», «кінематографічний рух камери»), або ви наклали суперечливі вказівки: наїзд, поки суб’єкт іде на камеру, чи панорама плюс нахил плюс кран в одному чотирисекундному кліпі.

Правка: один рух камери на кліп, названий кіномовою й прив’язаний до чогось, що відбувається в кадрі. Далі перевірте на конфлікт: якщо суб’єкт рухається до об’єктива, камера має стояти або відступати, а не наїжджати.

Було: "Epic cinematic camera movement, zoom in and pan around the hero as he runs at the camera, dynamic angles."

Стало: "The hero runs toward camera down a corridor. The camera retreats ahead of him at a steady pace, holding him at medium framing. Low angle, wide lens, no other camera movement."

І Kling, і Seedance добре сприймають явні вказівки щодо камери, а Grok Imagine варто спробувати для вільніших, енергійних рухів, де точна крупність важить менше за відчуття. Якщо рух і далі відмовляється реєструватися, опишіть зміну в тому, що бачить глядач, — «the skyline enters frame from the bottom», — замість того щоб називати обладнання.

Правка 4: сцена дрейфує або особа змінюється на середині кліпу

Що ви бачите: суб’єкт починає як одна людина, а закінчує як її двоюрідний брат. Червона куртка стає бордовою, вітрина на задньому плані перебудовується, у кімнаті виростає друге вікно.

Чому так стається: ніщо в генерації не закріплює зовнішність. Текстові промпти описують категорію, а не конкретну людину, тож кожен кадр вільний трактувати «молоду жінку в червоній куртці» трохи інакше. Довша тривалість і насичений фон пришвидшують дрейф.

Правка: закріпіть зображенням, а тоді описуйте лише те, що змінюється. Коли ви вивантажуєте референс або стартовий кадр, повторення повного опису зовнішності в промпті активно шкодить — текст конкурує із зображенням. Тримайте фон простим і розбивайте довгі задуми на кілька коротких кадрів замість одного довгого дубля.

Було: "A young woman in a red jacket with brown hair walks through a busy market, 10 seconds, lots of detail, many people and stalls."

Стало: "Keep the referenced subject's face, hair, and red jacket unchanged. She walks forward past two stalls and stops to look right. Shallow depth of field so the market behind her stays soft. 5 seconds, single continuous shot."

Примітка

Робота з референсами відрізняється залежно від моделі. PixVerse C1 підтримує рух, керований референсом, і переходи від першого кадру до останнього, коли важать обидві композиції, а PixVerse V6 підтримує multi-shot-послідовності. Перевірте в композері, що саме показує вибрана модель, перш ніж писати промпт, який на це спирається.

Правка 5: текст і логотипи виходять нерозбірливими

Що ви бачите: вивіска, на якій написано «SHOPP», етикетка товару, що розчиняється в псевдолітерах, логотип, який мутує кожні кілька кадрів.

Чому так стається: відеомоделі генерують текст як текстуру, а не як гліфи, і будь-який рух перемальовує цю текстуру кадр за кадром. Дрібний кегль, текст на вигнутих чи рухомих поверхнях і текст у перспективній площині — найважчі випадки.

Правка: перестаньте просити відеомодель складати текст. Згенеруйте кадр моделлю для зображень, де ітерувати над типографікою дешево, а тоді анімуйте цей кадр. У промпті для відео процитуйте точний рядок, тримайте його коротким, а поверхню з написом — максимально пласкою й стабільною.

Було: "A cafe storefront with a big detailed sign, menu boards, and lots of signage as the camera swoops past."

Стало: "Animate the provided frame. The sign reading 'DAYLIGHT' stays flat to camera and unchanged. Slow lateral drift to the right, sign fully in frame the whole time, no other text visible."

В OmniArt перший крок можна виконати моделлю для зображень на кшталт GPT Image 2 або Seedream 5.0 Pro, а тоді відправити затверджений кадр у відеомодель у тому самому просторі. Для всього, що піде клієнтові, вважайте розбірливий текст завданням, яке за замовчуванням починається із зображення.

Правка 6: рух надто швидкий, смикається або йде ривками

Що ви бачите: кліп грає наче на швидкості 1,5×, або суб’єкт ледь помітно вібрує, або рух просувається видимими сходинками, а не плавно.

Чому так стається: прикметники інтенсивності читаються як швидкість. «Dynamic», «explosive», «energetic» та «action-packed» підштовхують модель утиснути більше змін у ту саму кількість кадрів. Друга поширена причина — забагато подій за надто малий час: три акценти за чотири секунди не залишають кадрів жодному з них.

Правка: приберіть слова інтенсивності й натомість задайте темп. Один акцент на кліп, вкажіть, що кадр безперервний, а якщо дії справді потрібно більше часу, просіть довшу тривалість, а не швидше виконання.

Було: "Explosive dynamic action shot, skateboarder doing tricks, fast energetic motion, rapid cuts."

Стало: "A skateboarder rolls up a ramp and lifts into one slow ollie at the top. Steady, even pace, single continuous shot, no cuts. Camera tracks alongside at the same speed."

Якщо тремтіння дрібне, а не структурне, спробуйте вищий рівень тієї самої родини моделей — стандартний замість швидкого чи міні, — бо нижчі рівні міняють часову стабільність на швидкість і вартість.

Правка 7: аудіо та синхрон губ не збігаються

Що ви бачите: рот рухається раніше або пізніше за слова, діалог триває із закритими губами, а мовлення тоне під музикою, яку модель додала сама.

Чому так стається: для синхрону губ потрібно, щоб рот був видимий, а репліка була досить короткою, щоб вміститися в кліп. Довгий діалог у п’ятисекундному кадрі змушує модель або кваплити рот, або втратити синхрон. Описи середовища на кшталт «with an epic soundtrack» запрошують музичну підкладку, яка конкурує з голосом.

Правка: один мовець, одна коротка репліка в лапках, чітко закомпонований і нічим не перекритий рот і жодних конкурентних вказівок щодо звуку. Кажіть, що має мовчати, так само явно, як і те, що має звучати.

Було: "Two people talking about the product launch with an epic soundtrack and city ambience, close-up."

Стало: "Medium close-up of one woman facing camera, mouth fully visible. She says: 'We ship on Friday.' Then she pauses and smiles. Quiet room tone only, no music."

Veo 3.1 генерує власне аудіо, зокрема діалоги, а PixVerse V6 підтримує звук на тарифі Free в OmniArt. Коли потрібна вам модель не має власного звуку, надійний шлях такий: згенерувати кліп без звуку, окремо створити голос моделлю мовлення на кшталт MiniMax Speech 2.8 чи ElevenLabs, а тоді змонтувати їх разом. Це ще й дає змогу перезаписати начитку, не перегенеровуючи картинку.

Швидкий довідник «симптом — правка»

Користуйтеся ним як таблицею сортування, коли кліп повернувся не таким. Змініть те, що в першій колонці, перш ніж чіпати будь-що інше.

СимптомЗмініть це першимПримітка щодо моделі
Спотворені обличчя чи рукиШирша крупність, коротший кліп, стартовий кадр із зображенняVeo 3.1, Kling для руху людей
Дію проігнорованоВинесіть дієслово вперед, одна конкретна діяSeedance, PixVerse C1
Немає руху камериОдин названий і вмотивований рух; заберіть конфліктиKling, Seedance, Grok Imagine
Дрейф сцени чи зовнішностіРеференсне зображення, описуйте лише зміниРеференси PixVerse C1, multi-shot у V6
Нерозбірливий текстСпершу згенеруйте кадр моделлю для зображеньGPT Image 2, Seedream 5.0 Pro, далі будь-яка відеомодель
Рух надто швидкий або смикаєтьсяПриберіть слова інтенсивності, задайте темп, довша тривалістьОбирайте стандартні рівні замість швидких чи міні
Розсинхрон губОдна коротка репліка в лапках, рот у кадрі, без музикиVeo 3.1, PixVerse V6 або окреме мовлення

Із чого почати в OmniArt

Візьміть свій останній невдалий кліп і продіагностуйте його за сімома симптомами вище. Застосуйте рівно одну правку, перегенеруйте й порівняйте — два проходи зазвичай показують, у чому була справа: у промпті чи у виборі моделі. Оскільки OmniArt тримає моделі для зображень, відео та аудіо в одному просторі, впертий кадр може переходити між підходами без перебудови всього налаштування: закріпіть його моделлю для зображень, спробуйте ще раз на другій відеомоделі або додайте голосову доріжку окремо.

Відкрийте простір створення, вставте виправлений промпт і залишайте ті дублі, які тримають форму.

Готові творити?

Почніть створювати вражаючий контент зі ШІ

Почати безкоштовно