Рейтинги Arena: дві заяви про друге місце за три дні
7 серпня xAI повідомила, що Imagine Image 2.0 посідає друге місце у світі. 10 серпня Microsoft заявила про друге місце MAI-Image-2.6 в тому самому рейтингу. Обидві казали правду — і ось що це говорить про читання рейтингів.

7 серпня 2026 року xAI анонсувала Imagine Image 2.0 й написала, що модель «посідає друге місце у світі і в генерації зображень із тексту, і в редагуванні зображень».
10 серпня 2026 року Microsoft анонсувала MAI-Image-2.6 як модель, що «посідає друге місце в рейтингу Arena з генерації зображень із тексту», і додала, що результат «упевнено ставить MAI-Image попереду провідних моделей від Meta, Google і xAI».
Той самий рейтинг. Та сама позиція. Різниця в три дні. Жодна з компаній не збрехала, і проміжок між цими двома реченнями — одна з найкорисніших речей, які можна цьогоріч дізнатися про оцінювання моделей, бо майже кожна заява про модель для зображень, яку ви прочитаєте, влаштована так само.
Що насправді сталося за ці три дні

Два анонси описують ту саму драбину в два різні моменти:
| Дата | Модель | Опублікована заява |
|---|---|---|
| 7 серпня | Imagine Image 2.0 (xAI) | «Посідає друге місце у світі» в генерації із тексту і в редагуванні зображень |
| 10 серпня | MAI-Image-2.6 (Microsoft) | Друге місце в рейтингу Arena з генерації із тексту; попереду Meta, Google і xAI |
Якщо читати це як послідовність, а не як суперечність, це просто зміна позиції: 7 серпня друге місце тримала xAI, а до 10 серпня його забрала Microsoft. Формулювання Microsoft навіть визнає цю передачу: назвати xAI серед моделей, які вона тепер випереджає, — конкретніша заява, ніж «ми другі», і саме ця частина речення датує іншу.
Обидві компанії чесно поставили виноски. Примітка до діаграми xAI звучить так: «Загальний Elo. Джерело: рейтинги Arena Image Edit і Text-to-Image (станом на 7 серпня 2026 року)». Це «станом на» виконує справжню роботу, і більшість читачів його проминає.
Найцікавіше — саме у формулюванні
Два точні речення все одно можна побудувати так, щоб вони спрацювали по-різному. Порівняйте їх:
- «Друге місце у світі» (xAI) — ширша рамка, ніж рейтинг, на який стаття посилається. Це читається як твердження про реальність; звужує його назад до конкретної діаграми в конкретний день саме виноска.
- «Попереду провідних моделей від Meta, Google і xAI» (Microsoft) називає конкурентів замість числа. Це легше спростувати, ніж позицію, — і швидше псується, бо запрошує рівно те порівняння, яке зламає наступний реліз.
- «І в генерації зображень із тексту, і в редагуванні зображень» (xAI) заявляє два рейтинги одразу. Заява Microsoft охоплює один. Читач, який перегляне обидві по діагоналі, обґрунтовано вирішить, що результат xAI ширший, — і 7 серпня так і було.
Жодне з формулювань не є маніпуляцією в нечесному сенсі. Обидва — це текст анонсу, який робить те, що робить текст анонсу: обирає правдиву рамку, яка подає найвигідніше. Ваше завдання як читача — помітити, яку саме рамку вам подали.
Порада
Побачивши заяву про рейтинг, знайдіть три речі, перш ніж повірити бодай чомусь щодо власного сценарію: дату, конкретний рейтинг і те, чи це число загальне, чи в межах категорії. Якщо анонс проминає бодай одне з трьох, вважайте заяву маркетингом, поки її не можна перевірити.
Ще одна пастка: ім’я в рейтингу може не збігатися з компанією
У власній виносці xAI є деталь, яку варто запам’ятати: «Моделі xAI зазначені в Arena під назвою SpaceXAI».
Якщо ви підете перевіряти заяву й шукатимете в рейтингу «xAI», ви його не знайдете. Це не унікальна риса одного провайдера: моделі з’являються під назвами лабораторій, внутрішніми кодовими іменами й анонімізованими псевдонімами під час тестування, тож модель, яку ви порівнюєте, може стояти в рейтингу під незнайомою вам назвою. Позицію, яку ви не можете знайти, ви не можете й перевірити.
Що насправді вимірює Elo в Arena
Рейтинги в стилі Arena проводять сліпі попарні порівняння: людина бачить два результати за одним промптом, не знаючи, яка модель зробила котрий, і обирає один. Ці голоси живлять рейтинг Elo — той самий механізм, що й у шахах.
У такої конструкції є справжні переваги. Її важко обіграти ретельно дібраними прикладами, вона фіксує сукупну людську перевагу, а не проміжну метрику, і вона рухається, коли модель справді стає кращою. +79 Elo, які Microsoft повідомляє для MAI-Image-2.6 порівняно з MAI-Image-2.5, — це змістовний сигнал, що людям більше подобалися її результати на змішаному наборі промптів.
Але вона має й структурні властивості, які одна позиція приховує:
- Це число, що котиться. Рейтинги оновлюються безперервно, поки надходять голоси. Позиція — це знімок екрана, а не властивість моделі.
- Позиції стискають відстані. Друге й третє місця може розділяти жменька очок Elo — цілком у межах довірчого інтервалу — або широкий розрив. Порядковий номер не каже про це нічого.
- Набір промптів у голосуванні — не ваш набір промптів. Сукупну перевагу рахують за тим, що подала спільнота, яка голосувала. Якщо ваша робота — упаковка тайською, ця спільнота вас майже не представляла.
- Перевага — не придатність. Голосувальники обирають зображення, яке їм більше подобається, за кілька секунд і без брифу. Вони не перевіряють, чи вцілів логотип, чи повторюється обличчя, чи текст юридично точний.
П’ять речей, яких позиція вам не скаже
Загальне місце — це справжній результат і поганий аргумент для покупки. Воно не скаже вам:
- Чи виграє модель у вашій категорії. Портрети, типографіка, товар та ілюстрація можуть мати різних лідерів. Microsoft винесла рендеринг тексту окремо (+91 Elo) саме тому, що результати в категорії й загальні результати розходяться.
- Скільки це коштує. Сторінка моделі MAI-Image-2.5 має діаграму «Elo в Image Arena проти репрезентативної ціни API за 1000 зображень» — сам провайдер вважає справжньою віссю якість на долар. У позиції немає ціни.
- Чи можете ви цим користуватися. Доступність, доступ до API, ліміти запитів і комерційні умови — окремі від якості. Модель може бути другою й недоступною для вас.
- Як вона ламається. Дві моделі з однаковим рейтингом можуть ламатися протилежно: одна дрейфує на зовнішності, друга калічить дрібний текст. Їхні режими збою важать для вашого конвеєра більше, ніж їхнє середнє.
- Чи розрив узагалі справжній. Без довірчих інтервалів «друге» й «четверте» можуть бути статистично нерозрізненними.
Попередження
Найпоширеніше хибне прочитання — вважати позицію тривкою. Обидві заяви з цієї статті були точними на дату публікації, і принаймні одна застаріла за 72 години. Будь-яка сторінка, що цитує позицію в рейтингу без дати, розповідає вам про минуле, не зізнаючись у цьому.
Чим це замінити: власним брифом на приймання
Рейтинги — притомний спосіб скласти короткий список і кепський спосіб ухвалити остаточне рішення. Заміна дешева й забирає близько години.
Напишіть один бриф, що представляє вашу справжню роботу, а тоді тримайте все незмінним, крім моделі:
- Візьміть одне справжнє завдання, а не показову ідею: упаковку, яку ви справді випускаєте, персонажа, який справді повторюється, постер зі справжнім юридичним рядком.
- Спершу напишіть критерії «пройшло / не пройшло», ще до того, як побачите бодай один результат. «Заголовок написано без помилок, ієрархія тримається, а літери з діакритикою рендеряться» — це можна перевірити. «Виглядає добре» — ні.
- Тримайте промпт, референсні зображення, співвідношення сторін і Seed однаковими для всіх моделей. Єдина змінна — модель.
- Генеруйте по кілька результатів на модель, а не по одному. Один вдалий результат — це такий самий доказ, як і галерея з анонсу.
- Перевірте той збій, якого боїтеся найбільше. Якщо ваш ризик — зовнішність, проженіть те саме обличчя шість разів. Якщо текст — проженіть найдовший рядок у найважчій для вас писемності.
- Запишіть результат разом із датою. Ваша власна нотатка старіє так само, як рейтинг, і вам захочеться знати, коли ви перевіряли востаннє.
Цей процес відповідає на запитання, на яке позиція відповісти не може: чи добра ця модель саме в тому, що мені потрібно, за ціну, яку я можу заплатити, сьогодні?
Розібраний приклад читання заяв провайдера проти опублікованих доказів — у нашому аналізі чотирьох промптів, які опублікувала Microsoft, і в розборі запуску Grok Imagine Image 2.0: це два релізи, довкола яких побудована ця стаття. Актуальне пряме порівняння верстки та фотореалізму — GPT Image 2 проти Nano Banana 2, де зіставлено дві моделі, доступні вже сьогодні.
Часті запитання
Що таке рейтинг Arena?
Arena — це публічна платформа оцінювання, яка ранжує ШІ-моделі за сліпими попарними голосами людей. Два результати за одним промптом показують без назв моделей, людина обирає один, і ці голоси дають рейтинг Elo та порядкове місце.
Як дві моделі можуть обидві бути другими?
Бо рейтинги оновлюються безперервно, і кожна заява — це знімок. Заява xAI датована 7 серпня 2026 року, а заяву Microsoft опубліковано 10 серпня 2026 року. Між цими датами друге місце перейшло з рук у руки, на що натякає й сам анонс Microsoft, називаючи xAI серед моделей, які вона випереджає.
Чи Elo — гарна міра якості моделі для зображень?
Це гарна міра сукупної сліпої людської переваги, а це справжній і важкий для підробки сигнал. Але це не міра результату в категорії, вартості, затримки, доступності чи надійності на конкретному брифі, і в заголовному числі немає довірчого інтервалу.
Чому я не можу знайти xAI в рейтингу Arena?
xAI у власному анонсі зазначає, що її моделі стоять в Arena під назвою SpaceXAI. Провайдери часто з’являються під назвами лабораторій або псевдонімами, тож модель може бути в рейтингу під іменем, яке не збігається з компанією, яку ви шукаєте.
Чи варто обирати модель за її позицією в рейтингу?
Використайте позицію, щоб скласти короткий список, а вирішуйте за власним брифом. Проженіть той самий промпт, референси, співвідношення сторін і критерії «пройшло / не пройшло» через двох-трьох кандидатів і судіть результати за тією роботою, яку ви справді випускаєте.
Як довго дійсна заява про позицію в рейтингу?
Фіксованої відповіді немає, але приклад із цієї статті перевернувся за три дні. Вважайте будь-яку недатовану заяву про рейтинг історичною й перевіряйте наново, перш ніж ухвалювати рішення, що на неї спирається.
Із чого почати в OmniArt
Практичний крок — перестати порівнювати анонси й почати порівнювати результати. Відкрийте простір OmniArt для зображень, візьміть один бриф, який вам справді треба здати, і проженіть його через дві моделі з однаковими вхідними даними та списком «пройшло / не пройшло», який ви написали заздалегідь.
OmniArt тримає моделі для зображень, відео, аудіо та музики в одному просторі, тож короткий список перетворюється на тест поруч, а не на дослідницький проєкт через чотири сайти й чотири сторінки оплати. Коли рейтинг перевернеться знову наступного місяця — а він перевернеться, — ви вже знатимете, яка модель виконує вашу роботу, і це єдиний рейтинг, який приносить гроші.
Готові творити?
Почніть створювати вражаючий контент зі ШІ