TutorialРуководства и инструкции10 мин чтения

Как собрать целый бренд-сет изображений с помощью ИИ

Одно изображение сделать легко. Настоящая работа — чтобы пятое всё ещё выглядело тем же брендом. Вот порядок сборки единого продуктового сета и та ошибка, которая обязательно всплывает при масштабировании.

Команда OmniArt
Как собрать целый бренд-сет изображений с помощью ИИ

Сделать одно убедительное изображение продукта давно не является трудной частью. Трудная часть — сделать пятое и увидеть в нём всё тот же бренд: ту же геометрию логотипа, ту же гарнитуру, тот же текст этикетки, тот же материал, тот же свет.

Microsoft опубликовала на странице MAI-Image-2.5 набор примеров для вымышленного свечного бренда ORVA. Как маркетинг это пять красивых картинок. Как материал для разбора это кое-что полезнее: рабочий пример того, что держится по всей серии, что тихо уплывает и куда именно приземляется этот дрейф. Поэтому серия хорошо годится на роль каркаса для процесса, который вы можете повторить на любой сильной модели изображений.

Это руководство про сборку бренд-сета: в каком порядке генерировать, как писать каждый кадр, чтобы бренд его пережил, и про тот единственный сценарий отказа, который надёжно появляется, когда сет разрастается.

Что сет обязан удержать

Одиночному изображению достаточно хорошо выглядеть. Сет обязан не противоречить сам себе. Прежде чем что-то генерировать, выпишите то, что должно совпадать до символа во всех кадрах, — это и станет вашим списком приёмки:

ИнвариантЗначение для сета ORVA
Словесный знакORVA, контрастная антиква, широкий межбуквенный просвет
Второстепенный текстSCENTED CANDLE / BOUGIE PARFUMÉE
Мелкий шрифтNET WT. 8.5 OZ | 240 G
СосудЯнтарный стеклянный стакан, матовая поверхность, чёрная полоса у дна
ПалитраЯнтарь, чёрный шрифт, тёплые тона слоновой кости
СветЖёсткий направленный дневной свет с мягкими тенями листвы

Всё, чего нет в этом списке, может меняться — именно поэтому получается сет, а не пять копий. Список намеренно короткий. Длинный список инвариантов — это длинный список того, что модель может сломать.

Шаг 1: зафиксируйте идентичность на самой простой поверхности

Начните с кадра, где меньше всего конкурирующих элементов. Для знака это сам знак на простом материале:

Слово ORVA, вытисненное элегантной контрастной антиквой на фактурной бумаге цвета слоновой кости, с мягкими скользящими тенями по поверхности
Сначала пластина идентичности. Когда в кадре больше ничего нет, форма букв получает всё внимание модели — и это изображение становится референсом для всех последующих кадров. Источник: microsoft.ai.

У этого изображения одна задача: сделать правильные буквы. Ни продукта, ни сцены, ни второстепенного текста, конкурирующего за точность. Тиснение здесь полезный приём, потому что оно вынуждает модель определиться с единой геометрией букв: вдавленный край обязан идти по реальному контуру глифа, и ошибки становятся видимыми, а не прячутся в плоском наборе.

Как только кадр принят, он становится вашим референсом для всего дальнейшего. Не выводите логотип заново из текста в последующих промптах — переносите его.

Совет

Утвердите пластину идентичности до того, как сгенерируете хотя бы один продуктовый кадр. Все последующие изображения унаследуют её ошибки, а исправлять словесный знак на пятом кадре означает перегенерировать первые четыре, чтобы они совпали.

Шаг 2: соберите главный продуктовый кадр

Второе изображение добавляет сосуд и полную этикетку, по-прежнему на нейтральной поверхности и при контролируемом свете:

Горящая свеча ORVA в янтарном стекле на светлой поверхности; читаются и словесный знак, и строки SCENTED CANDLE и BOUGIE PARFUMÉE, и NET WT. 8.5 OZ 240 G, жёсткий свет отбрасывает тени листвы
Главный кадр несёт полную этикетку. Обратите внимание на É с диакритикой в BOUGIE PARFUMÉE и на строку с массой — именно эти две детали ломаются первыми. Источник: microsoft.ai.

Это изображение обязано быть безупречным, потому что именно с ним вы будете сверять все остальные. Три детали стоит проверить прицельно:

  • Символ с диакритикой. В «PARFUMÉE» есть É. Диакритика, лигатуры и нелатинские письменности — то место, где текст в изображении отказывает первым, а французская строка на свечной этикетке ровно тот мелкий текст, который никто не вычитывает, пока он не напечатан.
  • Строка с массой. «NET WT. 8.5 OZ | 240 G» смешивает десятичную дробь, две системы единиц и вертикальную черту. Если на вашей этикетке есть юридическая или регуляторная строка, проверять способность модели удержать её нужно здесь.
  • Типографическая иерархия. Словесный знак доминирует, описание продукта вторично, мелкий шрифт самый мелкий. Модель, которая пишет всё без ошибок, но даёт трём блокам одинаковый визуальный вес, произвела непригодную этикетку.

Шаг 3: поместите продукт в контекст

Когда главный кадр принят, сет расширяется в сцены. Каждый новый кадр меняет окружение и наследует продукт:

Та же горящая свеча ORVA на светлом деревянном столике в залитой солнцем гостиной, позади размытые кресло, плетёная ваза и ковёр
Лайфстайл-кадр. Этикетка, сосуд и чёрная полоса у дна переживают смену окружения; меняется направление света, а не бренд. Источник: microsoft.ai.

Промпт для такого кадра должен читаться как окружение плюс унаследованный продукт, а не как новое описание. Подробности достаются сцене, продукт указывается ссылкой:

Place the approved candle on a light oak coffee table in a sunlit living room. Keep the label, glass colour, and black base band exactly as in the reference. Blurred mid-century armchair and woven vase in the background, hard morning light, soft shadows across the table.

Прилагательные уходят окружению. Продукту достаётся инструкция сохранения. Обратный порядок — переописывать свечу в каждом кадре — и есть способ, которым сет уплывает: каждое новое описание даёт модели новый повод переосмыслить этикетку.

Шаг 4: добавьте кадры движения и настроения

Не каждое изображение сета обязано быть читаемым. Некоторые существуют ради ритма:

Банка со свечой ORVA кувыркается в воздухе на бледно-сером фоне, вокруг парят размытые листья эвкалипта, по этикетке идёт смаз от движения
Кадр движения. Словесный знак остаётся читаемым, а мелкий шрифт размыт — и здесь это правильно, потому что причина размытия — смаз от движения. Источник: microsoft.ai.

Этот кадр стоит прочесть внимательно, потому что он показывает разницу между допустимой мягкостью и дрейфом. Словесный знак ещё читается, мелкий шрифт — нет. В кадре с движением это физически верно: у кувыркающейся банки мелкий набор и должен быть нечитаемым. Проверка в том, названа ли в самом изображении причина этой нечитаемости. Размытие от движения — это приём. Размытие при неподвижной камере и неподвижном продукте — это дефект.

Шаг 5: групповой кадр и место, где сеты действительно ломаются

Последний кадр ставит продукт в компанию: тот самый ассортиментный снимок, который нужен любому бренду.

Горящая свеча ORVA на каменном подносе рядом с матовым флаконом с помпой, янтарным флаконом с пипеткой и небольшой банкой с деревянной крышкой, мягкий свет и тени пальмовых листьев
Групповой кадр. Словесный знак ORVA держится, но этикетка флакона с помпой слева отрисована как нечитаемый псевдотекст, а мелкий шрифт самой свечи деградировал. Источник: microsoft.ai.

Посмотрите на флакон с помпой слева. Его этикетка покрыта знаками, похожими на буквы, но это не слова ни на одном языке. Затем вернитесь к мелкому шрифту самой свечи в этом же изображении: «SCENTED CANDLE / BOUGIE PARFUMÉE» и строка с массой заметно мягче и искажённее, чем были в главном кадре.

Вот тот сценарий отказа, который стоит усвоить, и он не случаен: точность идёт следом за вниманием. Элемент, названный в промпте, отрисовывается верно. Элементы, которые просто присутствуют, получают правдоподобную текстуру там, где должен быть текст. Чем больше объектов вы добавляете в кадр, тем меньше бюджета модели достаётся каждому — значит, кадр с наибольшим количеством реквизита с наибольшей вероятностью выдаст бессмыслицу на этикетке, о которой вы даже не думали.

Предупреждение

Групповые кадры — место, где бренд-сеты ломаются, и ломаются тихо: неверный логотип заметен, а флакон с псевдотекстом на заднем плане читается как «флакон», пока кто-нибудь не приблизит. Проверяйте каждую читаемую поверхность группового кадра в полном разрешении перед приёмкой, а не только главный продукт.

Практический ответ — не избегать групповых кадров, а планировать их:

  • Не давайте второстепенным объектам текста вообще. Небрендированные спутники без этикеток и реалистичнее во флатлее, и испортить их невозможно.
  • Называйте одного героя на кадр. Прямо укажите, какой объект обязан нести точный брендинг, а остальные опишите как обобщённые формы и материалы.
  • Соберите композицию, а этикетку добавьте вторым редактированием. Сначала сгенерируйте расстановку, затем точечным редактированием поставьте корректный текст на тот единственный продукт, которому он нужен.
  • Кадрирование как запасной вариант. Если этикетка на фоне вышла шумом, а композиция в остальном верна, обрезать плотнее быстрее, чем генерировать заново.

Порядок, благодаря которому это работает

Весь процесс — это один принцип, применённый пять раз: установить то, что меняться не должно, а затем менять всё вокруг.

  1. Пластина идентичности. Знак один на простом материале. Утвердить форму букв.
  2. Главный продукт. Полная этикетка, нейтральная поверхность, контролируемый свет. Проверить диакритику, единицы и иерархию.
  3. Лайфстайл-контекст. Новое окружение, продукт переносится референсом и инструкцией сохранения.
  4. Настроение и движение. Мягкость допустима, когда изображение само называет её причину.
  5. Групповой кадр. Один названный герой, небрендированные спутники, проверка в полном разрешении.

Каждый шаг наследует предыдущему, а не начинается заново. В этом и разница между сетом и пятью снимками похожей свечи.

Частые вопросы

Как удержать логотип одинаковым на нескольких изображениях, сгенерированных ИИ?

Сначала утвердите одно изображение идентичности и переносите его как референс, вместо того чтобы заново описывать логотип в каждом промпте. Каждое новое текстовое описание — новый повод для модели переосмыслить форму букв.

Почему текст на изображениях ИИ выходит бессмыслицей?

Чаще всего потому, что элемент, несущий этот текст, не был назван в промпте. Модели распределяют точность на то, о чём их спросили; неназванные объекты получают текстуру, похожую на письмо. Так же бывает при очень мелком кегле, при диакритике и нелатинских письменностях, а также в перегруженных кадрах.

Сколько референсов использовать для продуктового сета?

Начните с одного утверждённого изображения идентичности или главного кадра и добавляйте референсы только для того, что действительно должно сохраниться, — обычно это продукт и его этикетка. Больше референсов не значит лучше: каждый из них борется за влияние на результат.

Генерировать бренд-сет одним промптом или несколькими?

Несколькими. Один кадр на промпт, каждый наследует утверждённый продукт: так после каждого изображения появляется контрольная точка, а при дрейфе понятен виновник. Один промпт на пять изображений лишает вас возможности изолировать отказ.

Что проверить перед приёмкой продуктового изображения?

Как минимум: геометрию словесного знака, каждую строку текста этикетки, включая диакритику и единицы, типографическую иерархию, материал и цвет сосуда, а также любой читаемый текст на второстепенных объектах. Проверять в полном разрешении, а не в размере миниатюры.

Можно ли использовать изображения продуктов от ИИ коммерчески?

Это зависит от условий модели, ваших прав на загруженные референсы и от того, не нарушает ли результат чужие товарные знаки или права на дизайн. Генерация брендоподобных изображений для бренда, которым вы не владеете, несёт реальные риски — проверьте коммерческие условия провайдера до публикации.

Как начать в OmniArt

Откройте пространство генерации изображений OmniArt и пройдите первые два шага на собственном бренде: пластина идентичности, затем главный продуктовый кадр с полной этикеткой. Остановитесь здесь и проверьте мелкий шрифт в полный размер, прежде чем идти дальше: эти два изображения решают, стоит ли генерировать оставшиеся три.

Приёмы написания промптов для каждого шага разобраны в материале про четыре промпта, опубликованных Microsoft, где речь идёт о назывании объекта, чтобы правка осталась локальной, и в руководстве по запуску Seedream 5.0 Pro — про управление референсами. Когда кадры утверждены, OmniArt держит модели изображений и видео в одном пространстве, так что утверждённый главный кадр можно сразу перевести в движение, не пересобирая бренд в другом месте.

Готовы создавать?

Начните генерировать впечатляющий контент с ИИ

Начать бесплатно