Промпти MAI-Image-2.6: чотири уроки від Microsoft AI
MAI-Image-2.6 від Microsoft посів 2-ге місце в Arena. Але довше житиме інша частина релізу — промпти, опубліковані поруч: чотири різні стилі та чотири правила, які можна застосувати до будь-якої моделі для зображень.

10 серпня 2026 року Microsoft AI оголосила MAI-Image-2.6 і повідомила, що модель посіла друге місце в рейтингу Arena для генерації зображень із тексту, додавши +79 Elo до MAI-Image-2.5 загалом, причому саме рендеринг тексту виріс на +91 Elo. Це заголовок — і, як більшість заголовків про рейтинги, він швидко псується.
Частина релізу з довшим терміном придатності тихіша: на сторінках MAI-Image-2, MAI-Image-2.5 і MAI-Image-2.6 Microsoft опублікувала справжні промпти, за якими зроблені зразкові зображення. Ці промпти не випадковий набір. Це чотири виразно різні способи писати до моделі для зображень, і кожен виконує свою роботу: описати, стиснути, відредагувати, послатися.
MAI-Image немає у виборі моделей OmniArt, тож це не огляд моделі, яку можна тут запустити. Це розбір промптового ремесла, бо саме ремесло переноситься. Чотири схеми нижче працюють на будь-якій сучасній сильній моделі для зображень, і урок у кожній має ту саму форму: те, що ви кладете в промпт, визначає, який саме збій ви отримаєте.
Що Microsoft випустила в MAI-Image 2, 2.5 і 2.6
Три релізи менш ніж за п’ять місяців, і в кожного свій центр ваги:
| Реліз | Оголошено | Позиціонування Microsoft | Заявка щодо Arena |
|---|---|---|---|
| MAI-Image-2 | 19 березня 2026 | Фотореалізм, текст усередині зображення, насичені сцени — «створено разом із креаторами» | 3-тє місце серед сімейств моделей |
| MAI-Image-2.5 | Сторінка моделі | Точне редагування, достовірність матеріалів, дизайнерська чутливість; варіанти Pro / standard / Flash | Третє місце в генерації з тексту станом на 2 червня 2026 |
| MAI-Image-2.6 | 10 серпня 2026 | Рендеринг тексту, портрети й 3D, комерційний та кінематографічний лоск | Друге місце в генерації з тексту; +79 Elo до 2.5 |
MAI-Image-2.5 також розділилася на сімейство: 2.5-Pro для стабільності об’єктів і візуального міркування, 2.5 для генерації плюс керованого редагування та 2.5-Flash, яку Microsoft описує як готову до продакшену за ціною менш ніж удвічі меншою за флагман. На сторінці 2.5 є графік «Elo в Image Arena проти показової ціни API за 1000 зображень» — і він показує, що команда оптимізує: не пікову якість саму по собі, а якість за долар.
Щодо 2.6 Microsoft каже, що є ще дещо, чого поки не деталізували: «робота з кількома референсами й багатше заземлення аж до більшого контролю над міркуванням, форматом і роздільною здатністю». Доки це не вийде публічно, це заява про дорожню карту, а не характеристика.
Урок 1: довгий структурований промпт кладе кожен факт у власне гніздо
Промпт за фотореалістичним зразком на сторінці MAI-Image-2.5 має приблизно 90 слів, і його структура цікавіша за довжину:
A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.
Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

Перечитайте це як форму, а не як речення. Перше речення — герой, поза, дія та небо. Друге — волосся й одяг. Третє — реквізит, по одному на руку. Четверте — злічуваний елемент. Далі позначений блок Behind her: забирає все, що стосується оточення, а двослівна вказівка про стиль закриває промпт.
Три речі в цій структурі роблять справжню роботу:
- Названі кольори замість прикметників. "Hot pink," "neon lime-green," "dark navy," "gold," "flat gray." Не «яскраво», не «барвисто». Назва кольору — це обмеження, яке модель може виконати або видимо провалити; «соковитий» — ні.
- Число замість кількісного слова. "Five iridescent bubbles of varying sizes" можна перевірити. «Кілька бульбашок» — ні. В опублікованому результаті кількість тримається: ви можете стати перед зображенням і провести аудит, і в цьому вся суть.
- Фон отримує власний контейнер.
Behind her:відгороджує оточення, щоб його деталі не протікали в опис героя. Довгі промпти ламаються тоді, коли моделі доводиться вгадувати, до якого іменника належить означення.
Ключове слово стилю стоїть останнім, після змісту, тож воно модифікує вже повністю задану сцену, а не керує самою композицією.
Порада
Пишіть довгі промпти як гнізда, а не як прозу: герой і дія, потім зовнішність, потім реквізит, потім злічувана деталь, потім позначений блок оточення, потім стиль. Якщо ви самі не можете показати, до якого гнізда належить слово, модель теж не зможе.
Урок 2: короткий промпт купує композицію порівнянням
В анонсі MAI-Image-2 опубліковано зовсім інший промпт — близько 30 слів, без речень, самі ранжовані частини:
A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

Уся хитрість — у першій частині. "Like a cathedral interior" — це не оздоба, а композиційна вказівка, замаскована під метафору. Собор приносить склепінчасту стелю, наву, що йде вдалину, арку, симетрію та світло, яке входить із дальнього кінця. У результаті є всі п’ять елементів, тільки з льоду. Описати таку побудову буквально коштувало б тридцяти слів і, найімовірніше, вийшло б дерев’яніше.
Другий корисний хід — tiny human figure at base for scale. Масштаб — це те, що моделі для зображень гублять найчастіше, бо ніщо у фактурі не підказує її розмір. Названий людський орієнтир на названій позиції фіксує масштаб чотирма словами, і червона куртка в результаті робить для композиції більше, ніж будь-яка кількість «епічно, велетенськи, колосально».
Хвостові терміни — cinematic, cold mist in air, hyper-real detail — це атмосфера й вказівки для рендерингу, і вони стоять останніми з тієї самої причини, що й ключове слово стилю в уроці 1.
Тож ці два промпти не є кращою й гіршою версіями одного й того самого. Це різні інструменти:
| Беріть довгий структурований промпт, коли | Беріть короткий стос, коли |
|---|---|
| Важать конкретний одяг, реквізит чи деталі бренду | Вам потрібне одне сильне зображення, і ви будете ітерувати |
| Хтось звірятиме результат із брифом | Настрій важить більше за перелік |
| Вам треба буде відтворити це пізніше | Ви досліджуєте вигляд |
| Кількості й кольори не обговорюються | Гарна аналогія може витягнути композицію |
Урок 3: у редагуванні один промпт має робити одну зміну
Сторінка MAI-Image-2.5 показує редагування трьома промптами, і вражає саме те, які кожен із них маленький:
Change the tote color to orange
Add peonies peeking out the tote
Edit this image to have the woman walking through the streets of New York City
Ось перший із них, до і після:


Промпт має шість слів: одне дієслово, один названий об’єкт, одне цільове значення. Він не просить водночас інший фон, новий ракурс чи краще світло. Ця стриманість і є прийомом, бо у правці найважча робота моделі — збереження, а не зміна. Усе, що ви додаєте до інструкції, — ще одна річ, яку модель може вирішити переробити.
Зверніть увагу й на те, що об’єкт названий. "The tote" дає моделі однозначний референт. "Make it orange" лишає моделі вибір між сумкою, столом і стіною.
Третій промпт — перенесення героїні в Нью-Йорк — виглядає значно більшою операцією, і так воно і є. Але це все одно одна операція, і вона все одно називає те, що має зберегтися: "the woman". Промпт із перенесенням, який заразом перевдягнув би її й змінив час доби, не залишив би вам жодного способу зрозуміти, яка саме вказівка дала поганий результат.
Попередження
Ланцюжок дрібних правок — це водночас ланцюжок дрібних дрейфів. Перевіряйте важливі для вас деталі після кожного кроку, а не лише наприкінці: тон шкіри, геометрія логотипа й текст першими тихо псуються за кілька проходів.
Урок 4: культурна відсилка дешева — і купує лише сцену
Найкоротший опублікований промпт має вісім слів:
Chihuahua in Abbey Road album cover with moptop wig


Вісім слів відтворюють дуже конкретну сцену: зебру, дорогу з деревами, що йде вдалину, білий VW Beetle ліворуч, автомобілі тієї епохи, перехожих у шістдесятницьких пальтах і плаский фронтальний кадр. Розписати це словами зайняло б абзац і, найімовірніше, все одно проґавило б Beetle. Microsoft подає це під рубрикою «знання про світ і міркування» — і це правильна рамка: добре відома відсилка є найстисненішим доступним токеном промпту.
Вона ж і найменш керована, і цей приклад показує рівно, де межа. Порівняйте два зображення: у джерелі кремовий гладкошерстий чихуахуа з великими стоячими вухами на чорному тлі. У результаті — біло-коричневий собака з іншою шерстю, іншими пропорціями й іншими вухами. Відсилка купила сцену. Героя вона не зберегла.
Саме ця різниця і є практичним уроком. Скорочення через відсилку чудово працює для побудови світу — жанру, епохи, конвенції освітлення, композиції. Для ідентичності воно ненадійне. Якщо конкретне обличчя, улюбленець, товар чи упаковка мають зберегтися, ця вимога належить явному опису або робочому процесу з референсним зображенням, а не культурному натяку.
Ще два застереження варто тримати в голові: відсилка спрацьовує лише тоді, коли модель її знає, тож маловідомі або регіональні відсилки тихо вироджуються в узагальнений результат, а славетні образи несуть питання прав, яких промпт за вас не розв’яже.
Чому саме рендеринг тексту став заголовною цифрою
З усього в анонсі 2.6 Microsoft винесла окремою цифрою саме текст: +91 Elo, вище за загальний приріст у +79 Elo. Це свідомий акцент, і зразкові роботи пояснюють чому.

Правильно написати заголовок — це легша половина. Афіша вище тримає ще й французьку назву з діакритикою, зірочку в рейтингу, перелік дат через кому і — найголовніше — ієрархію: рядок дат підпорядкований, заголовок домінує, ілюстрації віддано верхні дві третини. Модель, яка пише бездоганно, але зважує всі текстові блоки однаково, все одно видає непридатну верстку.
Це та частина генерації зображень, яка найближча до оплачуваної роботи, і саме тому цитати партнерів на сторінці 2.5 крутяться навколо неї. Глобальний креативний директор WPP Роб Райллі виділяє точність тексту як «справжній прорив» поряд із редагуванням природною мовою; Ванесса Сальво зі Shutterstock формулює важливий показник як здатність моделей «перекладати задум у стабільні, готові до продакшену результати». Упаковка, афіші, меню й кампанійні матеріали провалюються на типографіці раніше, ніж на фотореалізмі.
Що «2-ге місце в Arena» вам каже, а чого не каже
Результати Arena — це сліпі порівняння людських уподобань, тож великий стрибок Elo справді сигналізує, що людям більше подобалися результати на змішаному наборі промптів. Це справжній результат, і +79 Elo приблизно за два місяці — швидке сходження.
Це водночас одна агрегована цифра. В анонсі Microsoft немає ані Elo за категоріями, ані довірчих інтервалів, ані розміру набору промптів, ані назви моделі, що стоїть вище. Станом на 14 серпня 2026 року кілька речей, потрібних команді перед тим, як будувати на моделі пайплайн, досі не опубліковані:
- Ціна API за зображення для рівня 2.6
- Власна та максимальна роздільна здатність виводу
- Показники затримки для генерації та правок
- Робота з кількома референсами й заземлення, описані як «скоро»
- Технічний звіт за цифрами приросту Elo
Примітка
Загальне місце в Arena не скаже вам, чи пасує модель саме вашому завданню. Насичена текстом упаковка нелатинським письмом, обличчя, яке має повторитися у дванадцяти кадрах, і прозорий матеріал для ігрового інтерфейсу — це три різні перевірки, і модель може вести в сумі, програючи кожну з них окремо.
Чесне прочитання 2.6 вузьке, але корисне: Microsoft швидко ітерує це сімейство й спрямовує приріст на комерційний результат — текст, портрети, товар, брендинг, — а не на видовищність.
Як запустити ці чотири схеми в OmniArt
MAI-Image наразі недоступна у просторі для зображень OmniArt. А от схеми промптів доступні, і вони не залежать від моделі. Обирайте за тим, яким із чотирьох завдань насправді є ваш бриф:
| Схема | Для чого вона | Практична відправна точка в OmniArt |
|---|---|---|
| Довгий структурований промпт | Брифи, де звіряють одяг, реквізит, кольори й кількості | GPT Image 2 |
| Короткий стос із порівнянням | Кінематографічні поодинокі зображення та пошук настрою | Seedream 5.0 Pro |
| Одна зміна за прохід | Кольорові варіації товару, додавання, кероване перенесення | Nano Banana 2 |
| Відсилка плюс явна ідентичність | Побудова сцени, де герой має лишатися незмінним | Seedream 5.0 Pro із референсами |
| Дешеві ітерації до фіксації | Перевірка структури промпту за малі гроші | Qwen Image |
Корисна вправа: візьміть промпт про дах вище, запустіть його без змін, а потім запустіть ще раз, замінивши кольори прикметниками ("a pink bottle," "a green wand"), а кількість — на "some bubbles". Розрив між цими двома результатами і є вартістю структури, виміряною на вашій моделі, а не в галереї запуску.
Актуальне очне порівняння композиції та фотореалізму — у статті GPT Image 2 проти Nano Banana 2. Про стабільність за референсами розповідає посібник із запуску Seedream 5.0 Pro з розбором входів і керування, а посібник із Qwen Image — це дешевий шлях для ранніх чернеток. Схожий свіжий запуск для порівняння: Grok Imagine Image 2.0 зробив подібну заявку щодо Arena того самого тижня.
FAQ
Що таке MAI-Image-2.6?
MAI-Image-2.6 — модель Microsoft AI для генерації зображень із тексту, оголошена 10 серпня 2026 року. Microsoft каже, що вона посіла друге місце в рейтингу Arena для генерації з тексту, додавши +79 Elo до MAI-Image-2.5, причому рендеринг тексту виріс на +91 Elo.
Чим MAI-Image-2.6 відрізняється від MAI-Image-2.5?
Microsoft описує приріст у кожній виміряній категорії Arena з окремим наголосом на рендерингу тексту, портретах і 3D-зображеннях, а також на вилизанішому комерційному та фотореалістичному результаті в роботі з товаром, брендингом і кінематографічними кадрами. Введення кількох референсів, багатше заземлення й більший контроль над міркуванням, форматом та роздільною здатністю заявлені як такі, що з’являться, але без опублікованих деталей.
Де можна користуватися MAI-Image-2.6?
В анонсі Microsoft сказано, що модель доступна для генерації з тексту в Arena, того ж тижня з’являється в MAI Playground і розгортається в Microsoft Foundry та інших продуктах.
Чи є MAI-Image в OmniArt?
Ні. MAI-Image немає у виборі моделей для зображень в OmniArt. Схеми промптів із цієї статті не залежать від моделі, і їх можна запускати на тих моделях для зображень, які OmniArt пропонує.
Що таке сімейство моделей MAI-Image-2.5?
Три варіанти: MAI-Image-2.5-Pro для стабільності об’єктів і візуального міркування, MAI-Image-2.5 для якісної генерації з керованим редагуванням і MAI-Image-2.5-Flash, описана як готова до продакшену за ціною менш ніж удвічі меншою за флагманську модель.
Чи працюють ці схеми промптів на інших моделях для зображень?
Так. Названі кольори, явні кількості, відгороджений блок фону, орієнтир масштабу, одна зміна за правку й композиційне порівняння — це загальні прийоми промптингу. Між моделями різниться лише те, наскільки надійно кожен із них ушановується, і це варто перевіряти саме на тій моделі, якою ви користуєтеся.
Як почати в OmniArt
Відкрийте простір для зображень OmniArt і проженіть один бриф через дві з чотирьох схем вище — довгу структуровану й коротку стосову версію тієї самої ідеї. Тримайте героя незмінним і міняйте лише форму промпту. Це одне порівняння скаже вам про вашу модель більше, ніж будь-яке місце в рейтингу.
Далі ставтеся до редагування як до окремої роботи: затвердіть одне зображення, потім робіть одну зміну за промпт і перевіряйте важливі деталі після кожного проходу. OmniArt тримає моделі для зображень, відео, голосу та музики в одному просторі, тож затверджений кадр може одразу перейти в рух без зміни інструмента, — а коли нова модель заслужить своє місце у списку, промпти, які ви вже навчилися писати, підуть разом із вами.
Готові творити?
Почніть створювати вражаючий контент зі ШІ