Как читать рейтинги Arena: два вторых места за три дня
7 августа xAI сообщила, что Imagine Image 2.0 занимает второе место в мире. 10 августа Microsoft сообщила, что MAI-Image-2.6 занимает второе место в том же рейтинге. Обе компании говорили правду — и это лучший урок о том, как читать такие заявления.

7 августа 2026 года xAI представила Imagine Image 2.0 и написала: «it ranks second in the world in both text-to-image generation and image editing.»
10 августа 2026 года Microsoft представила MAI-Image-2.6 как «ranked second on the Arena text-to-image leaderboard» и добавила, что результат «firmly establishes MAI-Image ahead of leading models from Meta, Google and xAI.»
Один и тот же рейтинг, одна и та же позиция, разница в три дня. Ни одна из компаний не солгала. И разрыв между этими двумя фразами — одна из самых полезных вещей, которые можно узнать про оценку моделей в этом году, потому что почти любое заявление о модели изображений, которое вам попадётся, устроено как одно из них.
Что на самом деле произошло за эти три дня

Два анонса описывают одну и ту же лестницу в два разных момента:
| Дата | Модель | Опубликованное заявление |
|---|---|---|
| 7 августа | Imagine Image 2.0 (xAI) | Второе место в мире и в генерации из текста, и в редактировании |
| 10 августа | MAI-Image-2.6 (Microsoft) | Второе место в рейтинге Arena по генерации из текста; впереди Meta, Google и xAI |
Если читать это как последовательность, а не как противоречие, всё просто: 7 августа второе место занимала xAI, к 10 августа его забрала Microsoft. Формулировка Microsoft даже признаёт передачу — назвать xAI среди тех, кого обошли, это более конкретное утверждение, чем «мы вторые», и именно эта часть фразы датирует другое заявление.
Сноски у обеих компаний честные. В примечании к графику xAI написано: «Overall Elo. Source: Arena Image Edit and Text-to-Image leaderboards (as of Aug 7, 2026).» Это «as of» выполняет настоящую работу, и большинство читателей его пропускает.
Самое интересное — формулировки
Две достоверные фразы всё равно можно построить так, чтобы они приземлялись по-разному. Положим их рядом:
- «Second in the world» (xAI) — рамка шире, чем рейтинг, на который она ссылается. Это читается как утверждение о реальности; сужает его обратно до конкретной таблицы в конкретный день именно сноска.
- «Ahead of leading models from Meta, Google and xAI» (Microsoft) называет конкурентов вместо числа. Такое утверждение легче опровергнуть, чем позицию, — и оно быстрее портится, потому что само приглашает то сравнение, которое сломает следующий релиз.
- «On both text-to-image generation and image editing» (xAI) заявляет сразу о двух рейтингах. Заявление Microsoft охватывает один. Читатель, бегло просмотревший оба анонса, разумно решит, что результат xAI шире, — и 7 августа так и было.
Ничто из этого не является враньём в нечестном смысле. И то и другое — текст релиза, который делает то, что делает текст релиза: выбирает из правдивых формулировок самую выигрышную. Ваша задача как читателя — заметить, какую рамку вам вручили.
Совет
Увидев заявление о рейтинге, найдите три вещи, прежде чем поверить, что оно что-то значит для вашей задачи: дату, конкретный рейтинг и то, общая это цифра или по категории. Если в анонсе нет хотя бы одного пункта, считайте заявление маркетингом, пока его нельзя проверить.
Ещё одна ловушка: имя в рейтинге может не совпадать с компанией
В собственной сноске xAI есть деталь, которую стоит запомнить: «xAI models are listed on Arena under SpaceXAI.»
Если вы пойдёте проверять заявление и станете искать в рейтинге «xAI», вы ничего не найдёте. Это касается не одного провайдера: модели появляются под названиями лабораторий, внутренними кодовыми именами и анонимными псевдонимами во время тестирования, и модель, которую вы сравниваете, вполне может стоять в таблице под именем, которого вы не узнаёте. Позиция, которую нельзя найти, — это позиция, которую нельзя проверить.
Что на самом деле измеряет Elo в Arena
Рейтинги вроде Arena работают на слепых парных сравнениях: человек видит два результата по одному и тому же промпту, не зная, какая модель что сделала, и выбирает один. Эти голоса складываются в рейтинг Elo — тот же механизм, что и в шахматах.
У такой схемы есть настоящие достоинства. Её трудно обыграть отобранными примерами, она ловит совокупное человеческое предпочтение, а не суррогатную метрику, и она сдвигается, когда модель действительно становится лучше. Прирост +79 Elo, о котором Microsoft сообщает для MAI-Image-2.6 относительно MAI-Image-2.5, — осмысленный сигнал того, что людям чаще нравились её результаты на смешанном наборе промптов.
При этом у него есть структурные свойства, которые скрывает одна позиция:
- Это скользящее число. Рейтинги обновляются непрерывно по мере поступления голосов. Позиция — это скриншот, а не свойство модели.
- Позиции сжимают расстояния. Второе и третье места могут разделять несколько пунктов Elo — вполне внутри доверительного интервала — или заметный разрыв. Порядковый номер не говорит, что именно.
- Набор промптов — не ваш набор. Совокупное предпочтение считается по тому, что случайно отправила голосующая аудитория. Если ваша работа — упаковка на тайском, эта аудитория вас почти не представляла.
- Предпочтение — не пригодность. Голосующие за несколько секунд выбирают картинку, которая больше нравится, без брифа. Они не проверяют, уцелел ли логотип, повторяется ли лицо и корректен ли текст юридически.
Пять вещей, о которых позиция не расскажет
Общее место — настоящий результат и плохое основание для покупки. Оно не скажет вам:
- Выигрывает ли модель в вашей категории. У портретов, типографики, продукта и иллюстрации могут быть разные лидеры. Microsoft вынесла отрисовку текста отдельно (+91 Elo) именно потому, что категорийные и общие результаты расходятся.
- Сколько это стоит. На странице модели MAI-Image-2.5 есть график «Image Arena Elo против репрезентативной цены API за 1 000 изображений» — сам провайдер считает качество за деньги настоящей осью. В позиции цены нет.
- Сможете ли вы этим пользоваться. Доступность, доступ к API, лимиты запросов и коммерческие условия отделены от качества. Модель может быть второй и недоступной вам.
- Как она ломается. Две модели с одинаковым рейтингом могут ломаться противоположным образом: одна теряет тождество, другая калечит мелкий текст. Для вашего конвейера характер отказа важнее среднего.
- Реален ли разрыв. Без доверительных интервалов «второе» и «четвёртое» могут быть статистически неразличимы.
Предупреждение
Самое частое неверное прочтение — считать позицию долговечной. Оба заявления из этой статьи были точны на дату публикации, и как минимум одно устарело в течение 72 часов. Любая страница, которая цитирует место в рейтинге без даты, рассказывает вам о прошлом, не сообщая об этом.
Чем это заменить: собственный приёмочный бриф
Рейтинги разумно использовать, чтобы собрать короткий список, и плохо — чтобы принять итоговое решение. Замена стоит дёшево и занимает около часа.
Напишите один бриф, представляющий вашу настоящую работу, и зафиксируйте всё, кроме модели:
- Возьмите одну реальную задачу, а не витринную идею — упаковку, которую вы действительно выпускаете, персонажа, который действительно повторяется, плакат с настоящей юридической строкой.
- Сначала напишите критерии приёмки, до того как увидите любой результат. «Заголовок написан правильно, иерархия держится, диакритика отрисована» — проверяемо. «Выглядит хорошо» — нет.
- Держите промпт, референсы, соотношение сторон и seed одинаковыми для всех моделей. Единственная переменная — модель.
- Генерируйте по несколько результатов на модель, а не по одному. Один удачный результат — то же доказательство, что и галерея на странице релиза.
- Проверьте тот отказ, которого боитесь больше всего. Если риск в тождестве, прогоните одно лицо шесть раз. Если в тексте — возьмите самую длинную строку в самой трудной письменности.
- Запишите результат вместе с датой. Ваша собственная заметка стареет так же, как рейтинг, и вам захочется знать, когда вы проверяли в последний раз.
Эта процедура отвечает на вопрос, на который позиция ответить не может: хороша ли эта модель именно в том, что мне нужно, по цене, которую я готов платить, сегодня?
Разобранный пример чтения заявлений провайдера рядом с опубликованными материалами — наш разбор четырёх промптов, опубликованных Microsoft и анализ релиза Grok Imagine Image 2.0: это как раз те два релиза, вокруг которых построена эта статья. Свежее прямое сравнение по вёрстке и фотореализму — GPT Image 2 против Nano Banana 2, где сопоставлены две модели, доступные уже сегодня.
Частые вопросы
Что такое рейтинг Arena?
Arena — публичная платформа оценки, которая ранжирует модели ИИ по слепым парным голосам человеческого предпочтения. Два результата по одному промпту показывают без названий моделей, человек выбирает один, и эти голоса дают рейтинг Elo и порядковое место.
Как две модели могут занимать второе место?
Потому что рейтинги обновляются непрерывно, а каждое заявление — это снимок. Заявление xAI датировано 7 августа 2026 года, публикация Microsoft — 10 августа 2026 года. Между этими датами вторая позиция сменила владельца, на что намекает и сам анонс Microsoft, называя xAI среди обойдённых моделей.
Elo — хорошая мера качества модели изображений?
Это хорошая мера совокупного слепого человеческого предпочтения, а это реальный и трудноподделываемый сигнал. Но она не измеряет результат по категориям, стоимость, задержку, доступность или надёжность на конкретном брифе, и в заголовочной цифре нет доверительного интервала.
Почему я не нахожу xAI в рейтинге Arena?
xAI отмечает в собственном анонсе, что её модели перечислены на Arena под именем SpaceXAI. Провайдеры часто появляются под названиями лабораторий или псевдонимами, поэтому модель может стоять в рейтинге под именем, не совпадающим с искомой компанией.
Стоит ли выбирать модель по месту в рейтинге?
Используйте позицию, чтобы собрать короткий список, а решайте по собственному брифу. Прогоните один и тот же промпт, референсы, соотношение сторон и критерии приёмки через двух-трёх кандидатов и оцените результаты по работе, которую действительно выпускаете.
Как долго действительно заявление о рейтинге?
Точного ответа нет, но пример из этой статьи перевернулся за три дня. Считайте любое недатированное заявление о позиции историческим и перепроверяйте перед решением, которое от него зависит.
Как начать в OmniArt
Практичный шаг — перестать сравнивать анонсы и начать сравнивать результаты. Откройте пространство генерации изображений OmniArt, возьмите бриф, который вам действительно нужно сдать, и прогоните его через две модели с одинаковыми входными данными и списком критериев, написанным заранее.
OmniArt держит модели изображений, видео, аудио и музыки в одном пространстве, поэтому короткий список превращается в сравнение бок о бок, а не в исследовательский проект по четырём сайтам и четырём страницам оплаты. Когда рейтинг перевернётся снова в следующем месяце — а он перевернётся, — вы уже будете знать, какая модель делает вашу работу. Это единственный рейтинг, который приносит деньги.
Готовы создавать?
Начните генерировать впечатляющий контент с ИИ