Industry模型与洞察15 分钟阅读

读懂 Arena 排名:三天里的两个“第二”

8 月 7 日 xAI 说 Imagine Image 2.0 是世界第二。8 月 10 日微软说 MAI-Image-2.6 在同一榜单排第二。两边说的都是真话——这件事本身就教会你该怎么读排名。

OmniArt 团队
读懂 Arena 排名:三天里的两个“第二”

2026 年 8 月 7 日,xAI 发布 Imagine Image 2.0,写道:“it ranks second in the world in both text-to-image generation and image editing.”

2026 年 8 月 10 日,微软发布 MAI-Image-2.6,称其 “ranked second on the Arena text-to-image leaderboard”,并补充说这一结果 “firmly establishes MAI-Image ahead of leading models from Meta, Google and xAI.”

同一个榜单,同一个名次,相隔三天。两家公司都没有撒谎。而这两句话之间的差别,是你今年能学到的关于模型评测最有用的东西之一——因为你将读到的几乎每一条关于图片模型的声明,形状都和它们中的某一个相同。

这三天里究竟发生了什么

微软 AI 的发布主视觉:一个巨大的数字 2 和井号,内部填满自然、动物与人物的小照片,叠在关于渲染、成像、建模与艺术的淡色文字之上
微软为 MAI-Image-2.6 发布制作的主视觉,2026 年 8 月 10 日发布。来源:microsoft.ai。

这两份公告描述的是同一把梯子上的两个时刻:

日期模型公开的说法
8 月 7 日Imagine Image 2.0(xAI)在文生图图片编辑上“世界第二”
8 月 10 日MAI-Image-2.6(微软)Arena 文生图榜单第二;领先于 Meta、Google 和 xAI

把它当作一个先后顺序而不是一处矛盾来读,事情就很简单:8 月 7 日 xAI 占据第二,到 8 月 10 日微软拿走了它。微软的措辞其实承认了这次交接——点名 xAI 说自己领先于它,是比“我们第二”更具体的声明,而这一句恰恰给另一句标了日期。

两家的脚注都很诚实。xAI 的图表注释写着 “Overall Elo. Source: Arena Image Edit and Text-to-Image leaderboards (as of Aug 7, 2026).”。那句 “as of” 承担了实实在在的作用,而大多数读者会跳过它。

真正有意思的是措辞

两句都属实的话,仍然可以被造得落点不同。把它们并排看:

  • “Second in the world”(xAI)的框架比它引用的那个榜单更大。它读起来像是在陈述现实;把它收窄回“某一天的某一张图表”的,是脚注。
  • “Ahead of leading models from Meta, Google and xAI”(微软)点的是竞争对手而不是数字。它比一个名次更可证伪——也更易腐,因为它主动邀请了下一次发布来打破的那种比较。
  • “On both text-to-image generation and image editing”(xAI)一次声称了两个榜单。微软的声明只覆盖一个。一个快速扫过两份公告的读者会合理地认为 xAI 的结果更宽——在 8 月 7 日那天确实如此。

这都不是不诚实意义上的粉饰。两者都是发布文案在做发布文案该做的事:在为真的表述里挑一个最体面的。你作为读者的工作,是意识到自己被递到手上的是哪一个框架。

提示

看到榜单声明时,在相信它对你的场景有任何意义之前先找三样东西:日期、具体是哪个榜单,以及这个数字是总分还是分类别的。公告里缺任何一样,就先把它当营销话术,直到能被核实为止。

还有一个坑:榜上的名字可能不是公司名

xAI 自己的脚注里有一个值得记住的细节:“xAI models are listed on Arena under SpaceXAI.”

如果你想去榜单上搜 “xAI” 来核实这条声明,你找不到。这不是某一家的特例——模型会以实验室名、内部代号,或者测试期的匿名别名出现在榜上,你正在比较的某个模型可能挂在一个你认不出的名字下面。一个你定位不到的名次,就是一个你无法核实的名次。

Arena Elo 到底在测什么

Arena 这类榜单跑的是盲测两两对比:一个人看到同一条提示词的两份输出,不知道哪个模型做了哪一份,然后选一个。这些票汇成 Elo 评分——和国际象棋用的是同一套机制。

这个设计有实打实的优点。它很难用精挑细选的样例作弊,它捕捉的是人类整体偏好而不是某个代理指标,而且模型真的变好时它会动。微软报告的 MAI-Image-2.6 相对 MAI-Image-2.5 的 +79 Elo,是一个有意义的信号,说明在一组混合提示词上人们更偏好它的输出。

但它同时有一些被单个名次盖住的结构性特征:

  • **它是一个滚动数字。**票不断进来,评分持续更新。名次是一张截图,不是模型的属性。
  • **名次压缩了距离。**第二和第三之间可能只差几个 Elo 点——完全落在置信区间以内——也可能差一大截。序数本身不告诉你是哪种。
  • **提示词分布不是你的分布。**整体偏好是在投票人群恰好提交的那些内容上算出来的。如果你的活是泰语包装,那个人群几乎没有代表你。
  • **偏好不等于适配。**投票者在几秒钟内挑一张更喜欢的图,手上没有需求单。他们不会去核对 logo 有没有保住、脸有没有重复出来、文字在法律上准不准。

一个名次说明不了的五件事

一个总榜位置是真实的成绩,也是糟糕的采购依据。它不会告诉你:

  1. **它在你的类别里是否领先。**人像、排版、产品、插画各自的领先者可能都不同。微软之所以把文字渲染单独拎出来(+91 Elo),正是因为分类别结果和总分会分叉。
  2. **它多少钱。**MAI-Image-2.5 的模型页画的是“Image Arena Elo 对每千张图代表性 API 价格”——厂商自己都把质价比当成真正的坐标轴。名次里没有价格。
  3. **你能不能用上。**可用性、API 接入、速率限制和商用条款与质量是分开的。一个模型可以是第二,同时对你不可用。
  4. **它怎么坏。**评分相同的两个模型可能以相反的方式失败——一个在身份一致性上漂移,一个把小字糊掉。对你的管线来说,失败模式比平均分更重要。
  5. **差距是不是真的。**没有置信区间,“第二”和“第四”可能在统计上无法区分。

警告

最常见的误读是把名次当成耐久的事实。本文里的两条声明在各自发布日都属实,而其中至少一条在 72 小时内就过期了。任何引用榜单位置却不标日期的页面,都是在讲过去,却没告诉你这是过去。

拿什么替代它:你自己的验收单

榜单适合用来筛出候选名单,不适合用来做最终决定。替代方案很便宜,大约一小时。

写一份能代表你真实工作的需求单,然后把除了模型以外的一切都固定住:

  1. 挑一件真实的活,不是展示用的点子——你真要出的那款包装、真会反复出现的那个角色、带着真实法律行的那张海报。
  2. 先写通过/不通过的判据,在看到任何输出之前。“标题拼写正确、层级站得住、带音符的字母渲染出来了”是可核对的,“看起来不错”不是。
  3. **跨模型保持提示词、参考图、画幅和 seed 完全一致。**唯一的变量是模型。
  4. 每个模型多生成几张,不要只生成一张。单张走运的结果和发布页图库是同一种证据。
  5. **测你最怕的那种失败。**如果风险是身份一致性,就把同一张脸跑六次;如果是文字,就用你最难的那套文字跑最长的那串。
  6. **把结果连同日期一起记下来。**你自己的笔记和榜单一样会过期,而你会想知道自己上次是什么时候核实的。

这个流程回答了一个名次回答不了的问题:这个模型在我具体需要的事情上够不够好,价格我付不付得起,今天。

想看一个把厂商说法对着公开证据读的完整案例,可以读我们对微软公开的四条提示词的拆解,以及 Grok Imagine Image 2.0 的发布分析——正是本文中心的那两次发布。想看版式与写实度的最新对比,GPT Image 2 与 Nano Banana 2 对比比较的是两个你今天就能用的模型。

常见问题

Arena 榜单是什么?

Arena 是一个公开的评测平台,用盲测的两两人类偏好投票给 AI 模型排名。同一条提示词的两份输出在不显示模型名的情况下呈现,人选一个,这些票汇成 Elo 评分和一个序数排名。

两个模型怎么会都排第二?

因为评分持续更新,而每条声明都是一张快照。xAI 的说法标注日期是 2026 年 8 月 7 日,微软的发布日是 2026 年 8 月 10 日。在这两个日期之间第二的位置易主了,微软自己的公告点名 xAI 说领先于它,本身就暗示了这一点。

Elo 是衡量图片模型质量的好指标吗?

它是衡量整体盲测人类偏好的好指标,这是一个真实且难以伪造的信号。但它不衡量分类别表现、成本、延迟、可用性,也不衡量在某份具体需求单上的可靠性,而且标题里的那个数字不带置信区间。

为什么我在 Arena 榜单上找不到 xAI?

xAI 在自己的公告里注明,其模型在 Arena 上以 SpaceXAI 这个名字列出。厂商经常以实验室名或别名出现,所以一个模型可能挂在与你搜索的公司名不一致的名字下。

我该按榜单名次选模型吗?

用名次筛候选名单,然后用你自己的需求单做决定。把同样的提示词、参考图、画幅和通过判据跑过两三个候选,再拿输出去对你真正要交付的东西。

一条榜单声明能有效多久?

没有固定答案,但本文这个例子三天就翻篇了。任何不标日期的排名声明都按历史信息看待,在做依赖它的决定之前重新核实一次。

在 OmniArt 上开始

实际的做法是别再比公告,开始比输出。打开 OmniArt 图片工作台,拿一件你真要交付的活,用完全相同的输入和一份事先写好的通过判据跑过两个模型。

OmniArt 把图片、视频、音频和音乐模型放在同一个工作台里,所以一份候选名单会变成一次并排测试,而不是横跨四个站点和四个账单页的调研项目。等下个月榜单再次易主时——它一定会——你已经知道哪个模型能干你的活,而那是唯一能变现的排名。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始