Говорящий аватар и синхронизация губ для портретов
Соберите говорящий портрет с согласия для библиотечного приветствия из одного предложения: зафиксируйте лицо, запишите голос, проверьте тайминг рта вне OmniArt и просмотрите кадрирование к публикации.
Говорящий аватар — это портрет, который кажется говорящим. Полезная задача узкая: приветствие библиотеки, короткая реплика о продукте или вступление к уроку из одного-двух предложений. Это руководство берёт вымышленную помощницу библиотеки, Mara Chen, как пример планирования. Её реплика: Ваш заказ ждёт на стойке выдачи.
В OmniArt портрет готовят в пространстве изображений, а голос генерируют речевой моделью в пространстве аудио. В публичном каталоге есть модели изображений, модели видео и речевые модели. Отдельного управления синхронизацией губ или говорящим аватаром, которое накладывает сценарий на форму рта, в каталоге нет. Завершите совмещение во внешнем редакторе синхронизации губ, затем просмотрите файл в кадрировании, которое опубликуете. Фон категории — в заметках об аватарах, заметках о синхронизации губ и заметках о фотоаватаре.
Для чего нужен говорящий портрет
Берите говорящий портрет, когда лицо несёт сообщение, а кадр остаётся близким. Реплика Mara работает, потому что зрителю нужен один факт и место, куда смотреть: стойка выдачи, а не экскурсия по зданию. Запланируйте одну мысль, одно лицо и одно кадрирование. Кадр с полками принадлежит отдельному ролику.
Получите согласие, прежде чем оживлять лицо
Оживляйте лицо, которое создали вы, или реального человека, который согласился именно на это использование. Если Mara основана на коллеге, получите письменное «да» на портрет, на голос и на места, где выложите ролик.
Предупреждение
Обойдите частных лиц, публичных персон и голоса клиентов, которые вам нельзя имитировать. Когда результат — реалистичный синтетический человек, добавьте раскрытие, которого просит площадка назначения, в подписи или на самом изображении.
Напишите сценарий и выберите голос
Пишите на один выдох. «Ваш заказ ждёт на стойке выдачи» ложится чисто. Прочитайте реплику вслух. Если спотыкаетесь, сократите слова до генерации.
Сгенерируйте голос в пространстве аудио OmniArt и держите одну голосовую настройку на всю вещь. Руководство MiniMax Speech 2.8 разбирает дубли HD и Turbo и пунктуацию. Держите ту же настройку от тестовой реплики до финальной, включая короткую паузу с каждого края.
Прогоните тест синхронизации на одной короткой реплике
До любого внешнего инструмента сделайте короткий тест «изображение в видео»: у Mara небольшой кивок или моргание. Этот тест проверяет свет, плечи и то, остаётся ли лицо лицом Mara. Он не утверждает, что рот совпадает со словами. Видеомодель, которая принимает изображение, может сдвинуть стоп-кадр. Это движение не управление, которое привязывает кадры к файлу голоса.
Возьмите утверждённый голос в редактор синхронизации губ вне OmniArt и синхронизируйте только это одно предложение. Проиграйте на обычной скорости со звуком. Рот должен открыться на первом слове и успокоиться, когда фраза кончается, а челюсть остаётся прикреплённой к лицу.
Если тест не проходит, измените один вход. Возьмите более ясный стоп-кадр анфас, более медленное чтение или более чистый аудиофайл. Например, отклоните селфи в три четверти с втянутым подбородком, если оно прячет нижнюю губу: инструменту синхронизации, возможно, придётся выдумать недостающий край рта. Это критерий отклонения, а не результат теста, который мы проводили.
Держите лицо неизменным между дублями
Mara нужны те же глаза, тот же пробор и открытый ворот в стоп-кадре, в тесте движения и в синхронизированном экспорте. Повторно используйте утверждённое изображение. Руководство по персонажу применяется и здесь, хотя исполнение — одно предложение.
Утверждённый стоп-кадр снят на уровне глаз, окно библиотеки за её левым плечом, и ничего не пересекает рот. Солнцезащитные очки, рука у подбородка, сильное размытие и крутой профиль прячут формы, которые редактору синхронизации губ нужно прочитать.
Просмотрите ролик в финальном кадрировании
Просмотрите экспортированный файл в кадрировании, которое опубликуете. Для библиотечного поста 9:16 поставьте субтитры ниже подбородка, чтобы они не пересекали рот. Проверьте, что глаза по-прежнему встречают объектив после кадрирования, что в голосе нет комнатного шипения и что слова на экране совпадают с произнесённой репликой.
Посмотрите один раз ради смысла и один раз ради рта. Кадр, который на паузе выглядит резким, может всё ещё опаздывать в начале фразы. Держите музыку тише голоса. Если кадрирование срезает ворот, вернитесь к утверждённому стоп-кадру.
С чего начать в OmniArt
Сгенерируйте Mara как оригинальный портрет анфас в пространстве изображений: оба глаза и рот свободны. Сгенерируйте голос из одного предложения в пространстве аудио и сохраните этот дубль. Видеомодель используйте только для короткого теста движения стоп-кадра. Синхронизацию губ завершите во внешнем редакторе, затем посмотрите финальное кадрирование с субтитрами на месте, прежде чем публиковать.
Готовы создавать?
Начните генерировать впечатляющий контент с ИИ