Arena 排名解讀:三天內出現兩個「世界第二」
8 月 7 日,xAI 說 Imagine Image 2.0 是世界第二。8 月 10 日,微軟說 MAI-Image-2.6 在同一份排行榜上是第二。兩邊都說了實話——這件事告訴你該怎麼讀排名。

2026 年 8 月 7 日,xAI 發表 Imagine Image 2.0,寫著「它在文生圖和圖片編輯兩項上都排名世界第二」。
2026 年 8 月 10 日,微軟發表 MAI-Image-2.6,稱它「在 Arena 文生圖排行榜上排名第二」,並補上這個結果「讓 MAI-Image 穩穩地站在 Meta、Google 和 xAI 的領先模型之前」。
同一份排行榜。同一個名次。相隔三天。兩家公司都沒有說謊,而這兩句話之間的落差,是你今年能學到關於模型評測最有用的事情之一——因為你會讀到的幾乎每一則圖片模型宣稱,長得都像它們其中一句。
那三天裡實際發生了什麼

這兩則發表描述的是同一座梯子上的兩個時刻:
| 日期 | 模型 | 公開的宣稱 |
|---|---|---|
| 8 月 7 日 | Imagine Image 2.0(xAI) | 在文生圖和圖片編輯上都「排名世界第二」 |
| 8 月 10 日 | MAI-Image-2.6(微軟) | 在 Arena 文生圖排行榜上排名第二;領先 Meta、Google 和 xAI |
把它讀成一個序列而不是一組矛盾,這就只是一次名次變動:8 月 7 日第二名在 xAI 手上,到了 8 月 10 日被微軟拿走。微軟的措辭其實也承認了這次交接——點名 xAI 是它現在領先的對象之一,這比「我們是第二」更具體,而且正是這半句替另外那半句標上了日期。
兩家公司的註腳都老實。xAI 的圖表註記寫著「總體 Elo。來源:Arena Image Edit 和 Text-to-Image 排行榜(截至 2026 年 8 月 7 日)」。那個「截至」其實扛了很多重量,而大多數讀者會直接跳過。
措辭才是有意思的地方
兩句都正確的話,還是可以蓋成不同的落點。把它們並排看:
- 「世界第二」(xAI)是一個比它引用的那份排行榜更寬的框。它讀起來像是在陳述現實;把它收窄回某一天某一張圖表的,是那條註腳。
- 「領先 Meta、Google 和 xAI 的領先模型」(微軟)點的是競爭對手,而不是一個數字。這比一個名次更可被證偽——也更容易過期,因為它剛好邀請了下一次發表就會推翻的那組比較。
- 「文生圖和圖片編輯兩項上」(xAI)一次宣稱了兩份榜。微軟的宣稱只涵蓋一份。一個把兩則都快速掃過的讀者,合理地會得出 xAI 的結果比較寬的結論,而在 8 月 7 日那天確實如此。
這兩句都不是不誠實意義上的話術。它們都是發表文案在做發表文案該做的事:在為真的那幾種框法裡,挑最好看的那個。你身為讀者的工作,是察覺自己被遞到手上的是哪一個框。
小技巧
看到一則排行榜宣稱時,先找三件事,再決定要不要相信它跟你的使用情境有關:日期、是哪一份榜,以及那個數字是總體還是分類的。如果發表內容漏掉其中任何一件,在能查證之前就先把它當行銷話術看待。
還有一個陷阱:榜上的名字不一定是那家公司
xAI 自己的註腳裡有一個值得記住的細節:「xAI 的模型在 Arena 上是以 SpaceXAI 這個名字列出的。」
如果你為了查證而去排行榜上找 "xAI",你不會找到。這不是單一服務商特有的現象——模型會以實驗室名稱、內部代號,或測試期間的匿名別名出現,而你正在比較的某個模型,可能就掛在一個你認不出來的名字底下。一個你定位不到的名次,就是一個你無法查證的名次。
Arena Elo 到底在測什麼
Arena 這類排行榜跑的是盲測兩兩比較:一個人看到同一句提示詞的兩份輸出,不知道哪一份出自哪個模型,然後選一份。這些票餵給一套 Elo 評分,跟西洋棋用的是同一套機制。
這個設計有真正的強項。它很難用精挑細選的樣本作弊,它捕捉的是整體的人類偏好而不是某個代理指標,而且模型真的變好時它會動。微軟報告的 MAI-Image-2.6 相對 MAI-Image-2.5 的 +79 Elo,是一個有意義的訊號:在一組混合的提示詞上,人們比較偏好它的輸出。
它同時也有一些被單一名次藏起來的結構性特質:
- 它是一個滾動的數字。 票進來,評分就持續更新。一個名次是一張截圖,不是模型的屬性。
- 名次會壓縮距離。 第二和第三之間可能只差幾點 Elo——遠在信賴區間之內——也可能差一大截。序數本身完全不告訴你是哪一種。
- 那組提示詞不是你的提示詞。 整體偏好是在投票族群剛好送出的那些東西上算出來的。如果你的工作是泰文包裝設計,那個族群幾乎沒有代表到你。
- 偏好不等於適用。 投票者在幾秒鐘內、沒有需求說明的情況下,挑他們比較喜歡的那張圖。他們不會去檢查標誌有沒有活下來、一張臉有沒有重現,或文字在法律上是否正確。
一個名次告訴不了你的五件事
一個總體名次是真實的結果,卻是很差的採購依據。它不會告訴你:
- 它在你那個分類贏不贏。 人像、字體排印、產品和插畫,各自的領先者可能都不一樣。微軟把文字算繪單獨拆出來報告(+91 Elo),正是因為分類結果和總體結果會分岔。
- 它多少錢。 MAI-Image-2.5 的模型頁把「Image Arena Elo 對每千張圖片的代表性 API 價格」畫成一張圖——服務商自己就把每一塊錢的品質當成真正的軸。一個名次裡面沒有價格。
- 你用不用得到。 開放程度、API 存取、速率限制和商用條款,都跟品質是分開的。一個模型可以既是第二名,又對你不開放。
- 它怎麼壞。 兩個評分相同的模型,壞的方式可能完全相反——一個在長相上漂移,一個把小字弄爛。對你的流程來說,它們的失敗模式比平均值重要得多。
- 那個差距是不是真的。 沒有信賴區間,「第二」和「第四」在統計上可能分不出來。
注意
最常見的誤讀,是把名次當成耐久的東西。這篇文章裡的兩則宣稱在各自發佈那天都是正確的,其中至少一則在 72 小時內就過時了。任何引用排行榜名次卻不附日期的頁面,都是在跟你講過去的事,卻沒有講明白。
該用什麼取代它:你自己的驗收需求
排行榜是拿來拉入圍名單的合理方法,卻是拿來做最終決定的爛方法。取代它的做法很便宜,大約一小時就能做完。
寫一份代表你真實工作的需求,然後除了模型以外,其他全部固定住:
- 挑一件真正的工作,不是展示用的點子——你真的要出的那個包裝、真的會重複出現的那個角色、真的帶法律聲明那行字的那張海報。
- 先寫下通過/不通過的判準,在你看到任何輸出之前。「主標拼寫正確、層次撐得住、帶重音符號的字元算得出來」是可以檢查的。「看起來不錯」不行。
- 提示詞、參考圖、畫面比例和 Seed 在各個模型之間保持一致。 唯一的變數是模型。
- 每個模型生成好幾份輸出,不是一份。單一次的好運氣,跟一份發表用的作品集是同一種證據。
- 測你最怕的那種失敗。 如果你的風險在長相一致,就把同一張臉跑六次。如果在文字,就拿你最長的字串、用你最難的文字系統跑。
- 把結果連同日期寫下來。 你自己的筆記跟排行榜一樣會老,而你會想知道自己上次查是什麼時候。
這套流程回答的是一個名次答不出來的問題:這個模型在我需要的那件具體的事情上好不好,價格我付不付得起,就在今天?
想看一個把服務商宣稱對照公開證據來讀的實例,可以看我們對微軟公布的那四句提示詞的拆解,以及我們的 Grok Imagine Image 2.0 發表分析——這兩次發表正是本文的主角。想看版面和寫實感的當期正面對決,GPT Image 2 對 Nano Banana 2 比較的是兩個你今天就能跑的模型。
常見問題
Arena 排行榜是什麼?
Arena 是一個公開的評測平台,用盲測的兩兩人類偏好投票來替 AI 模型排名。同一句提示詞的兩份輸出在不顯示模型名稱的情況下並排呈現,由人挑一份,這些票再產生出 Elo 評分和序數排名。
兩個模型怎麼可能都是第二名?
因為評分是持續更新的,而每一則宣稱都是一張快照。xAI 的宣稱標的日期是 2026 年 8 月 7 日,微軟的則發佈於 2026 年 8 月 10 日。在這兩個日期之間,第二名換了手——微軟自己的發表內容,也因為把 xAI 列進它領先的對象裡而暗示了這件事。
Elo 是衡量圖片模型品質的好指標嗎?
它是衡量整體盲測人類偏好的好指標,那是一個真實而且不容易造假的訊號。它不是分類表現、成本、延遲、開放程度,或針對某一份具體需求的可靠度的指標,而且它標頭上的那個數字不帶信賴區間。
為什麼我在 Arena 排行榜上找不到 xAI?
xAI 在自己的發表內容裡註明,它的模型在 Arena 上是以 SpaceXAI 這個名字列出的。服務商經常以實驗室名稱或別名出現,所以某個模型可能掛在一個對不上你搜尋的那家公司的名字底下。
我該根據排行榜名次挑模型嗎?
用名次拉出入圍名單,然後用你自己的需求做決定。把同一組提示詞、參考素材、畫面比例和通過/不通過判準跑過兩三個候選,再拿你真的要交出去的作品去評判那些輸出。
一則排行榜宣稱能撐多久?
沒有固定答案,但這篇文章自己的例子三天就翻盤了。任何沒有日期的排名宣稱都當成歷史看待,而且在做出依賴它的決定之前重新查一次。
在 OmniArt 上開始
務實的做法是別再比較發表內容,開始比較輸出。打開 OmniArt 圖片工作台,拿一份你真的得交出去的需求,用完全相同的輸入和一份你事先寫好的通過/不通過清單,跑過兩個模型。
OmniArt 把圖片、影片、音訊和音樂模型放在同一個工作台裡,所以一份入圍名單會變成一次並排測試,而不是一個橫跨四個網站、四個帳單頁面的研究專案。等到下個月排行榜又翻一次——它一定會——你已經知道哪個模型做得了你的工作,而那才是唯一付得出錢來的排名。
準備好開始創作了嗎?
用 AI 生成精彩內容