Промпты MAI-Image-2.6: четыре урока от Microsoft
MAI-Image-2.6 от Microsoft вышла на второе место в Arena. Но дольше проживёт другая часть релиза — опубликованные рядом промпты: четыре способа письма и четыре правила, которые переносятся на любую модель.

10 августа 2026 года Microsoft AI представила MAI-Image-2.6 и сообщила, что модель заняла второе место в рейтинге Arena по генерации изображений из текста: +79 Elo к MAI-Image-2.5 в целом и +91 Elo только по отрисовке текста. Это заголовок, а заголовки из рейтингов устаревают быстро.
Часть релиза с куда более длинным сроком годности звучит тише: на страницах MAI-Image-2, MAI-Image-2.5 и MAI-Image-2.6 Microsoft опубликовала сами промпты, стоящие за примерами изображений. Это не случайный набор. Это четыре отчётливо разных способа писать для модели изображений, и каждый решает свою задачу — описать, сжать, отредактировать, сослаться.
MAI-Image нет в списке моделей OmniArt, поэтому перед вами не обзор модели, которую можно запустить здесь. Это разбор промпт-мастерства, которое там видно, — потому что мастерство переносится. Четыре шаблона ниже работают на любой сильной современной модели изображений, и вывод в каждом случае имеет одну форму: то, что вы кладёте в промпт, определяет, какую именно ошибку вы получите.
Что принесли MAI-Image 2, 2.5 и 2.6
Три релиза меньше чем за пять месяцев, и у каждого свой центр тяжести.
| Релиз | Анонс | Позиционирование Microsoft | Заявка по Arena |
|---|---|---|---|
| MAI-Image-2 | 19 марта 2026 | Фотореализм, текст внутри изображения, насыщенные сцены — «сделано вместе с креаторами» | 3-е место среди семейств моделей |
| MAI-Image-2.5 | Страница модели | Точное редактирование, достоверность материалов, дизайн-пригодный результат; Pro / стандарт / Flash | 3-е место в генерации из текста, на 2 июня 2026 |
| MAI-Image-2.6 | 10 августа 2026 | Отрисовка текста, портреты и 3D, коммерческая и кинематографичная отделка | 2-е место в генерации из текста; +79 Elo к 2.5 |
MAI-Image-2.5 также разделилась на семейство: 2.5-Pro — для консистентности объектов и визуальных рассуждений, 2.5 — для генерации вместе с управляемым редактированием, 2.5-Flash — по описанию Microsoft, готовая к продакшену версия дешевле половины стоимости флагмана. На странице 2.5 есть график «Image Arena Elo против репрезентативной цены API за 1 000 изображений», и он показывает, что команда оптимизирует: не только пик качества, но качество за деньги.
Про 2.6 Microsoft говорит, что есть ещё не раскрытое — «от работы с несколькими референсами и более богатого граундинга до большего контроля над рассуждением, форматом и разрешением». Пока это не вышло публично, это заявление о планах, а не спецификация.
Урок 1: длинный структурный промпт кладёт каждый факт в свою ячейку
Промпт за примером фотореализма на странице MAI-Image-2.5 занимает около 90 слов, и его устройство интереснее длины.
A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.
Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

Перечитайте его как форму, а не как текст. Первое предложение — объект, поза, действие и небо. Второе — волосы и одежда. Третье — реквизит, по одному предмету на руку. Четвёртое — исчисляемый элемент. Затем помеченный блок Behind her: забирает всё, что относится к окружению, и промпт закрывает стилевая директива из двух слов.
В этой конструкции по-настоящему работают три вещи.
- Названия цветов вместо прилагательных. «Hot pink», «neon lime-green», «dark navy», «gold», «flat gray». Не «яркий» и не «красочный». Название цвета — это ограничение, которое модель может выполнить или заметно провалить; «vibrant» таким ограничением не является.
- Число вместо неопределённого количества. «Five iridescent bubbles of varying sizes» проверяемо, «some bubbles» — нет. В опубликованном результате число сходится: можно встать перед изображением и пересчитать, и в этом весь смысл.
- У фона свой контейнер.
Behind her:огораживает окружение, и его детали не протекают в описание объекта. Длинные промпты рушатся там, где модели приходится угадывать, к какому существительному относится определение.
Стилевое слово стоит последним, после содержания, и потому применяется к уже полностью заданной сцене, а не управляет самой композицией.
Совет
Пишите длинные промпты ячейками, а не прозой: объект и действие, затем внешность, затем реквизит, затем исчисляемая деталь, затем помеченный блок окружения, затем стиль. Если вы сами не можете показать, в какую ячейку попадает слово, модель тем более не сможет.
Урок 2: короткий промпт покупает композицию сравнением
В анонсе MAI-Image-2 опубликован совсем другой промпт — около 30 слов, без предложений, только группы слов по убыванию важности.
A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

Первая группа слов — и есть весь приём. «Like a cathedral interior» не украшение, а композиционная инструкция, переодетая в метафору. Собор приносит с собой сводчатый потолок, уходящий вглубь неф, арку, симметрию и свет, входящий с дальнего конца. В результате есть все пять, только выполненные во льду. Описать эту компоновку буквально стоило бы тридцати слов и вышло бы жёстче.
Второй полезный ход — tiny human figure at base for scale. Масштаб модели изображений теряют охотнее всего, потому что текстура сама по себе не сообщает размер. Названный человеческий ориентир в названной точке фиксирует его четырьмя словами, и красная куртка в результате делает для композиции больше, чем любое количество «epic, massive, enormous».
Замыкающие термины — cinematic, cold mist in air, hyper-real detail — это атмосфера и директивы рендера, и они стоят последними по той же причине, что и стилевое слово в уроке 1.
Так что эти два промпта — не удачная и неудачная версии одного и того же. Это разные инструменты.
| Длинный структурный промпт — когда | Короткий составной промпт — когда |
|---|---|
| важны конкретная одежда, реквизит, детали бренда | нужен один сильный кадр, дальше итерации |
| результат будут сверять с брифом | настроение важнее перечня объектов |
| его нужно будет воспроизвести позже | вы исследуете визуальный язык |
| количество и цвета не обсуждаются | хорошее сравнение способно вынести композицию |
Урок 3: в редактировании один промпт меняет одно
Страница MAI-Image-2.5 показывает редактирование тремя промптами, и бросается в глаза, насколько каждый из них мал.
Change the tote color to orange
Add peonies peeking out the tote
Edit this image to have the woman walking through the streets of New York City
Вот первый, до и после.


В промпте шесть слов: один глагол, один названный объект, одно целевое значение. Он не просит заодно другой фон, другой ракурс или свет получше. Эта сдержанность и есть приём, потому что при редактировании самая трудная задача модели — сохранить, а не изменить. Всё, что вы добавляете в инструкцию, — ещё одна вещь, которую она может решить переделать.
Обратите внимание и на то, что объект назван. «The tote» даёт модели однозначный референт. «Сделай его оранжевым» оставляет модели выбор между сумкой, столом и стеной.
Третий промпт — перенести героиню в Нью-Йорк — выглядит куда более крупной операцией, и так оно и есть. Но это по-прежнему одна операция, и она по-прежнему называет то, что должно сохраниться: «the woman». Промпт, который заодно поменял бы наряд и время суток, лишил бы вас возможности понять, какая именно инструкция испортила результат.
Предупреждение
Цепочка мелких правок — это ещё и цепочка мелких смещений. Проверяйте важные для вас детали после каждого шага, а не только в конце: тон кожи, геометрия логотипа и текст деградируют первыми и незаметно.
Урок 4: культурная отсылка дёшева, и покупает она только сцену
Самый короткий из опубликованных промптов — восемь слов.
Chihuahua in Abbey Road album cover with moptop wig


Восемь слов воссоздают очень конкретную сцену: зебру, уходящую вглубь аллею, припаркованный слева белый Beetle, машины эпохи, прохожих в пальто шестидесятых и плоскую фронтальную композицию. Расписать это словами заняло бы абзац и, скорее всего, всё равно упустило бы Beetle. Microsoft относит такое к «знанию о мире и рассуждению», и это верная рамка: широко известная отсылка — самый сжатый промпт из доступных.
Она же и наименее управляемая, и этот пример показывает, где именно проходит граница. Сравните два изображения: в исходнике кремовый гладкошёрстный чихуахуа со стоячими ушами на чёрном фоне. В результате — бело-коричневая собака с другой шерстью, другими пропорциями и другими ушами. Отсылка купила сцену. Объект она не сохранила.
Именно это различие и есть практический вывод. Отсылка-скоропись отлично поднимает мир — жанр, эпоху, световую конвенцию, компоновку. Для тождества она ненадёжна. Если конкретное лицо, питомец, продукт или упаковка обязаны сохраниться, это требование должно жить в явном описании или в работе с референсами, а не в культурном намёке.
Ещё два ограничения стоит держать в голове: отсылка работает только если модель её знает, поэтому редкие или локальные отсылки тихо вырождаются в обобщённый результат; а за известными изображениями тянутся вопросы прав, которые промпт за вас не решает.
Почему отрисовка текста стала главной цифрой
Из всего анонса 2.6 Microsoft вынесла отдельно именно текст: +91 Elo, выше общего прироста в +79 Elo. Это осознанный акцент, и примеры объясняют почему.

Правильно написать заголовок — лёгкая половина задачи. Афиша выше удерживает ещё и французский топоним с диакритикой, звёздочку в категории, перечисление дат через запятые и, что важнее всего, иерархию: строка дат подчинена, заголовок доминирует, иллюстрации отданы верхние две трети. Модель, которая пишет безошибочно, но даёт всем текстовым блокам одинаковый визуальный вес, всё равно выдаёт непригодную вёрстку.
Это самая близкая к оплачиваемой работе часть генерации изображений, поэтому и цитаты партнёров на странице 2.5 крутятся вокруг неё. Глобальный креативный директор WPP Rob Reilly называет точность текста «настоящим прорывом» наряду с редактированием на естественном языке; Vanessa Salvo из Shutterstock формулирует ключевую метрику как способность модели «переводить намерение в консистентный, готовый к продакшену результат». Упаковка, афиши, меню и кампанийные материалы проваливаются на типографике раньше, чем на фотореализме.
Что говорит и чего не говорит «второе место в Arena»
Результаты Arena — это слепое сравнение человеческих предпочтений, поэтому крупный прирост Elo действительно сигнал: людям чаще нравились эти результаты на смешанном наборе промптов. Результат настоящий, и +79 Elo примерно за два месяца — быстрый подъём.
При этом это одна агрегированная цифра. Анонс Microsoft не публикует ни Elo по категориям, ни доверительные интервалы, ни размер набора промптов, ни название модели, стоящей выше. На 14 августа 2026 года несколько вещей, нужных команде до запуска конвейера, остаются неопубликованными:
- Цена API за изображение для уровня 2.6
- Нативное и максимальное разрешение вывода
- Задержки генерации и редактирования
- Мультиреференсные возможности и граундинг, описанные как «скоро»
- Технический отчёт за разницей в Elo
Примечание
Общее место в Arena не говорит, подходит ли модель именно вашей задаче. Насыщенная текстом упаковка на нелатинском письме, лицо, которое должно повториться в двенадцати кадрах, и прозрачный ассет для игрового интерфейса — три разные проверки, и модель вполне может лидировать в сумме и проиграть любую из них.
Честное прочтение 2.6 узкое и всё же полезное: Microsoft быстро итерирует это семейство и направляет прирост на коммерческий результат — текст, портреты, продукт, бренд, — а не на зрелищность.
Как применять эти четыре шаблона в OmniArt
MAI-Image сейчас недоступна в пространстве генерации изображений OmniArt. Шаблоны промптов — доступны, и они не привязаны к модели. Выбирайте по тому, какой из четырёх задач ваш бриф на самом деле является.
| Шаблон | Для чего | С чего начать в OmniArt |
|---|---|---|
| Длинный структурный промпт | Брифы, где сверяют одежду, реквизит, цвета и количество | GPT Image 2 |
| Короткий составной промпт со сравнением | Кинематографичные одиночные кадры и поиск настроения | Seedream 5.0 Pro |
| Редактирование по одному изменению за раз | Цветовые версии продукта, дополнения, контролируемый перенос | Nano Banana 2 |
| Отсылка-скоропись плюс явное описание объекта | Сборка мира, где объект должен оставаться прежним | Seedream 5.0 Pro с референсами |
| Дешёвые итерации до фиксации | Недорого проверить структуру промпта | Qwen Image |
Полезное упражнение: запустите промпт про крышу как есть, а затем ещё раз, заменив названия цветов прилагательными («a pink bottle», «a green wand») и число — на «some bubbles». Разрыв между двумя результатами и есть цена структуры, измеренная на вашей модели, а не в галерее на странице релиза.
Свежее прямое сравнение по вёрстке и фотореализму — в материале GPT Image 2 против Nano Banana 2. Про консистентность на референсах читайте руководство по запуску Seedream 5.0 Pro, а руководство по Qwen Image — недорогой путь для ранних набросков. Сопоставимый недавний разбор релиза: Grok Imagine Image 2.0, где на той же неделе прозвучала похожая заявка по Arena.
Частые вопросы
Что такое MAI-Image-2.6?
MAI-Image-2.6 — модель генерации изображений из текста от Microsoft AI, представленная 10 августа 2026 года. Microsoft сообщает, что она заняла второе место в рейтинге Arena по генерации из текста с приростом +79 Elo к MAI-Image-2.5 и +91 Elo по отрисовке текста.
Чем MAI-Image-2.6 отличается от MAI-Image-2.5?
Microsoft описывает прирост во всех измеренных категориях Arena, отдельно выделяя отрисовку текста, портреты и 3D, а также более отточенный коммерческий и фотореалистичный результат в продуктовых, брендовых и кинематографичных задачах. Ввод нескольких референсов, более богатый граундинг и больший контроль над рассуждением, форматом и разрешением описаны как предстоящие, без опубликованных подробностей.
Где можно использовать MAI-Image-2.6?
По анонсу Microsoft, она доступна для генерации из текста в Arena, позже на той же неделе появляется в MAI Playground и затем разворачивается в Microsoft Foundry и других продуктах.
Есть ли MAI-Image в OmniArt?
Нет. В списке моделей изображений OmniArt MAI-Image отсутствует. Шаблоны промптов из этой статьи не привязаны к модели, и их можно применять к тем моделям изображений, которые OmniArt предлагает.
Что входит в семейство MAI-Image-2.5?
Три варианта: MAI-Image-2.5-Pro для консистентности объектов и визуальных рассуждений, MAI-Image-2.5 для качественной генерации с управляемым редактированием и MAI-Image-2.5-Flash, описанная как готовая к продакшену дешевле половины стоимости флагмана.
Работают ли эти шаблоны промптов на других моделях?
Да. Названия цветов, явные количества, огороженный блок фона, ориентир масштаба, одно изменение за правку и композиционное сравнение — общие приёмы работы с промптами. Между моделями различается лишь то, насколько надёжно каждый приём соблюдается, и это стоит проверить на той модели, которой вы пользуетесь.
Как начать в OmniArt
Откройте пространство генерации изображений OmniArt и прогоните один бриф через два из четырёх шаблонов выше — длинную структурную и короткую составную версии одной идеи. Оставьте объект прежним и меняйте только форму промпта. Это единственное сравнение расскажет о вашей модели больше, чем любое место в рейтинге.
Дальше относитесь к редактированию как к отдельной работе: утвердите одно изображение, затем меняйте по одному за промпт и после каждого прохода проверяйте важные детали. OmniArt держит модели изображений, видео, аудио и музыки в одном пространстве, поэтому утверждённый кадр переходит в движение без смены инструмента, а когда новая модель заслужит место в списке, промпты, которые вы уже научились писать, придут вместе с вами.
Готовы создавать?
Начните генерировать впечатляющий контент с ИИ