IndustryМодели и аналитика9 мин чтения

Как читать рейтинги Arena: два вторых места за три дня

7 августа xAI сообщила, что Imagine Image 2.0 занимает второе место в мире. 10 августа Microsoft сообщила, что MAI-Image-2.6 занимает второе место в том же рейтинге. Обе компании говорили правду — и это лучший урок о том, как читать такие заявления.

Команда OmniArt
Как читать рейтинги Arena: два вторых места за три дня

7 августа 2026 года xAI представила Imagine Image 2.0 и написала: «it ranks second in the world in both text-to-image generation and image editing.»

10 августа 2026 года Microsoft представила MAI-Image-2.6 как «ranked second on the Arena text-to-image leaderboard» и добавила, что результат «firmly establishes MAI-Image ahead of leading models from Meta, Google and xAI.»

Один и тот же рейтинг, одна и та же позиция, разница в три дня. Ни одна из компаний не солгала. И разрыв между этими двумя фразами — одна из самых полезных вещей, которые можно узнать про оценку моделей в этом году, потому что почти любое заявление о модели изображений, которое вам попадётся, устроено как одно из них.

Что на самом деле произошло за эти три дня

Анонсная графика Microsoft AI: крупная цифра 2 со знаком решётки, заполненная маленькими фотографиями природы, животных и людей, поверх бледного текста о рендеринге, обработке изображений, моделировании и искусстве
Собственная анонсная графика Microsoft для MAI-Image-2.6, опубликована 10 августа 2026 года. Источник: microsoft.ai.

Два анонса описывают одну и ту же лестницу в два разных момента:

ДатаМодельОпубликованное заявление
7 августаImagine Image 2.0 (xAI)Второе место в мире и в генерации из текста, и в редактировании
10 августаMAI-Image-2.6 (Microsoft)Второе место в рейтинге Arena по генерации из текста; впереди Meta, Google и xAI

Если читать это как последовательность, а не как противоречие, всё просто: 7 августа второе место занимала xAI, к 10 августа его забрала Microsoft. Формулировка Microsoft даже признаёт передачу — назвать xAI среди тех, кого обошли, это более конкретное утверждение, чем «мы вторые», и именно эта часть фразы датирует другое заявление.

Сноски у обеих компаний честные. В примечании к графику xAI написано: «Overall Elo. Source: Arena Image Edit and Text-to-Image leaderboards (as of Aug 7, 2026).» Это «as of» выполняет настоящую работу, и большинство читателей его пропускает.

Самое интересное — формулировки

Две достоверные фразы всё равно можно построить так, чтобы они приземлялись по-разному. Положим их рядом:

  • «Second in the world» (xAI) — рамка шире, чем рейтинг, на который она ссылается. Это читается как утверждение о реальности; сужает его обратно до конкретной таблицы в конкретный день именно сноска.
  • «Ahead of leading models from Meta, Google and xAI» (Microsoft) называет конкурентов вместо числа. Такое утверждение легче опровергнуть, чем позицию, — и оно быстрее портится, потому что само приглашает то сравнение, которое сломает следующий релиз.
  • «On both text-to-image generation and image editing» (xAI) заявляет сразу о двух рейтингах. Заявление Microsoft охватывает один. Читатель, бегло просмотревший оба анонса, разумно решит, что результат xAI шире, — и 7 августа так и было.

Ничто из этого не является враньём в нечестном смысле. И то и другое — текст релиза, который делает то, что делает текст релиза: выбирает из правдивых формулировок самую выигрышную. Ваша задача как читателя — заметить, какую рамку вам вручили.

Совет

Увидев заявление о рейтинге, найдите три вещи, прежде чем поверить, что оно что-то значит для вашей задачи: дату, конкретный рейтинг и то, общая это цифра или по категории. Если в анонсе нет хотя бы одного пункта, считайте заявление маркетингом, пока его нельзя проверить.

Ещё одна ловушка: имя в рейтинге может не совпадать с компанией

В собственной сноске xAI есть деталь, которую стоит запомнить: «xAI models are listed on Arena under SpaceXAI.»

Если вы пойдёте проверять заявление и станете искать в рейтинге «xAI», вы ничего не найдёте. Это касается не одного провайдера: модели появляются под названиями лабораторий, внутренними кодовыми именами и анонимными псевдонимами во время тестирования, и модель, которую вы сравниваете, вполне может стоять в таблице под именем, которого вы не узнаёте. Позиция, которую нельзя найти, — это позиция, которую нельзя проверить.

Что на самом деле измеряет Elo в Arena

Рейтинги вроде Arena работают на слепых парных сравнениях: человек видит два результата по одному и тому же промпту, не зная, какая модель что сделала, и выбирает один. Эти голоса складываются в рейтинг Elo — тот же механизм, что и в шахматах.

У такой схемы есть настоящие достоинства. Её трудно обыграть отобранными примерами, она ловит совокупное человеческое предпочтение, а не суррогатную метрику, и она сдвигается, когда модель действительно становится лучше. Прирост +79 Elo, о котором Microsoft сообщает для MAI-Image-2.6 относительно MAI-Image-2.5, — осмысленный сигнал того, что людям чаще нравились её результаты на смешанном наборе промптов.

При этом у него есть структурные свойства, которые скрывает одна позиция:

  • Это скользящее число. Рейтинги обновляются непрерывно по мере поступления голосов. Позиция — это скриншот, а не свойство модели.
  • Позиции сжимают расстояния. Второе и третье места могут разделять несколько пунктов Elo — вполне внутри доверительного интервала — или заметный разрыв. Порядковый номер не говорит, что именно.
  • Набор промптов — не ваш набор. Совокупное предпочтение считается по тому, что случайно отправила голосующая аудитория. Если ваша работа — упаковка на тайском, эта аудитория вас почти не представляла.
  • Предпочтение — не пригодность. Голосующие за несколько секунд выбирают картинку, которая больше нравится, без брифа. Они не проверяют, уцелел ли логотип, повторяется ли лицо и корректен ли текст юридически.

Пять вещей, о которых позиция не расскажет

Общее место — настоящий результат и плохое основание для покупки. Оно не скажет вам:

  1. Выигрывает ли модель в вашей категории. У портретов, типографики, продукта и иллюстрации могут быть разные лидеры. Microsoft вынесла отрисовку текста отдельно (+91 Elo) именно потому, что категорийные и общие результаты расходятся.
  2. Сколько это стоит. На странице модели MAI-Image-2.5 есть график «Image Arena Elo против репрезентативной цены API за 1 000 изображений» — сам провайдер считает качество за деньги настоящей осью. В позиции цены нет.
  3. Сможете ли вы этим пользоваться. Доступность, доступ к API, лимиты запросов и коммерческие условия отделены от качества. Модель может быть второй и недоступной вам.
  4. Как она ломается. Две модели с одинаковым рейтингом могут ломаться противоположным образом: одна теряет тождество, другая калечит мелкий текст. Для вашего конвейера характер отказа важнее среднего.
  5. Реален ли разрыв. Без доверительных интервалов «второе» и «четвёртое» могут быть статистически неразличимы.

Предупреждение

Самое частое неверное прочтение — считать позицию долговечной. Оба заявления из этой статьи были точны на дату публикации, и как минимум одно устарело в течение 72 часов. Любая страница, которая цитирует место в рейтинге без даты, рассказывает вам о прошлом, не сообщая об этом.

Чем это заменить: собственный приёмочный бриф

Рейтинги разумно использовать, чтобы собрать короткий список, и плохо — чтобы принять итоговое решение. Замена стоит дёшево и занимает около часа.

Напишите один бриф, представляющий вашу настоящую работу, и зафиксируйте всё, кроме модели:

  1. Возьмите одну реальную задачу, а не витринную идею — упаковку, которую вы действительно выпускаете, персонажа, который действительно повторяется, плакат с настоящей юридической строкой.
  2. Сначала напишите критерии приёмки, до того как увидите любой результат. «Заголовок написан правильно, иерархия держится, диакритика отрисована» — проверяемо. «Выглядит хорошо» — нет.
  3. Держите промпт, референсы, соотношение сторон и seed одинаковыми для всех моделей. Единственная переменная — модель.
  4. Генерируйте по несколько результатов на модель, а не по одному. Один удачный результат — то же доказательство, что и галерея на странице релиза.
  5. Проверьте тот отказ, которого боитесь больше всего. Если риск в тождестве, прогоните одно лицо шесть раз. Если в тексте — возьмите самую длинную строку в самой трудной письменности.
  6. Запишите результат вместе с датой. Ваша собственная заметка стареет так же, как рейтинг, и вам захочется знать, когда вы проверяли в последний раз.

Эта процедура отвечает на вопрос, на который позиция ответить не может: хороша ли эта модель именно в том, что мне нужно, по цене, которую я готов платить, сегодня?

Разобранный пример чтения заявлений провайдера рядом с опубликованными материалами — наш разбор четырёх промптов, опубликованных Microsoft и анализ релиза Grok Imagine Image 2.0: это как раз те два релиза, вокруг которых построена эта статья. Свежее прямое сравнение по вёрстке и фотореализму — GPT Image 2 против Nano Banana 2, где сопоставлены две модели, доступные уже сегодня.

Частые вопросы

Что такое рейтинг Arena?

Arena — публичная платформа оценки, которая ранжирует модели ИИ по слепым парным голосам человеческого предпочтения. Два результата по одному промпту показывают без названий моделей, человек выбирает один, и эти голоса дают рейтинг Elo и порядковое место.

Как две модели могут занимать второе место?

Потому что рейтинги обновляются непрерывно, а каждое заявление — это снимок. Заявление xAI датировано 7 августа 2026 года, публикация Microsoft — 10 августа 2026 года. Между этими датами вторая позиция сменила владельца, на что намекает и сам анонс Microsoft, называя xAI среди обойдённых моделей.

Elo — хорошая мера качества модели изображений?

Это хорошая мера совокупного слепого человеческого предпочтения, а это реальный и трудноподделываемый сигнал. Но она не измеряет результат по категориям, стоимость, задержку, доступность или надёжность на конкретном брифе, и в заголовочной цифре нет доверительного интервала.

Почему я не нахожу xAI в рейтинге Arena?

xAI отмечает в собственном анонсе, что её модели перечислены на Arena под именем SpaceXAI. Провайдеры часто появляются под названиями лабораторий или псевдонимами, поэтому модель может стоять в рейтинге под именем, не совпадающим с искомой компанией.

Стоит ли выбирать модель по месту в рейтинге?

Используйте позицию, чтобы собрать короткий список, а решайте по собственному брифу. Прогоните один и тот же промпт, референсы, соотношение сторон и критерии приёмки через двух-трёх кандидатов и оцените результаты по работе, которую действительно выпускаете.

Как долго действительно заявление о рейтинге?

Точного ответа нет, но пример из этой статьи перевернулся за три дня. Считайте любое недатированное заявление о позиции историческим и перепроверяйте перед решением, которое от него зависит.

Как начать в OmniArt

Практичный шаг — перестать сравнивать анонсы и начать сравнивать результаты. Откройте пространство генерации изображений OmniArt, возьмите бриф, который вам действительно нужно сдать, и прогоните его через две модели с одинаковыми входными данными и списком критериев, написанным заранее.

OmniArt держит модели изображений, видео, аудио и музыки в одном пространстве, поэтому короткий список превращается в сравнение бок о бок, а не в исследовательский проект по четырём сайтам и четырём страницам оплаты. Когда рейтинг перевернётся снова в следующем месяце — а он перевернётся, — вы уже будете знать, какая модель делает вашу работу. Это единственный рейтинг, который приносит деньги.

Готовы создавать?

Начните генерировать впечатляющий контент с ИИ

Начать бесплатно