Industry模型與觀察閱讀時間 16 分鐘

Arena 排名解讀:三天內出現兩個「世界第二」

8 月 7 日,xAI 說 Imagine Image 2.0 是世界第二。8 月 10 日,微軟說 MAI-Image-2.6 在同一份排行榜上是第二。兩邊都說了實話——這件事告訴你該怎麼讀排名。

OmniArt 團隊
Arena 排名解讀:三天內出現兩個「世界第二」

2026 年 8 月 7 日,xAI 發表 Imagine Image 2.0,寫著「它在文生圖和圖片編輯兩項上都排名世界第二」。

2026 年 8 月 10 日,微軟發表 MAI-Image-2.6,稱它「在 Arena 文生圖排行榜上排名第二」,並補上這個結果「讓 MAI-Image 穩穩地站在 Meta、Google 和 xAI 的領先模型之前」。

同一份排行榜。同一個名次。相隔三天。兩家公司都沒有說謊,而這兩句話之間的落差,是你今年能學到關於模型評測最有用的事情之一——因為你會讀到的幾乎每一則圖片模型宣稱,長得都像它們其中一句。

那三天裡實際發生了什麼

微軟 AI 的發表視覺:一個帶井字號的巨大數字 2,內部填滿自然、動物和人物的小張照片,底下是關於算繪、影像、建模和藝術的淡色文字
微軟自己替 MAI-Image-2.6 製作的發表視覺,發佈於 2026 年 8 月 10 日。來源:microsoft.ai。

這兩則發表描述的是同一座梯子上的兩個時刻:

日期模型公開的宣稱
8 月 7 日Imagine Image 2.0(xAI)在文生圖圖片編輯上都「排名世界第二」
8 月 10 日MAI-Image-2.6(微軟)在 Arena 文生圖排行榜上排名第二;領先 Meta、Google 和 xAI

把它讀成一個序列而不是一組矛盾,這就只是一次名次變動:8 月 7 日第二名在 xAI 手上,到了 8 月 10 日被微軟拿走。微軟的措辭其實也承認了這次交接——點名 xAI 是它現在領先的對象之一,這比「我們是第二」更具體,而且正是這半句替另外那半句標上了日期。

兩家公司的註腳都老實。xAI 的圖表註記寫著「總體 Elo。來源:Arena Image Edit 和 Text-to-Image 排行榜(截至 2026 年 8 月 7 日)」。那個「截至」其實扛了很多重量,而大多數讀者會直接跳過。

措辭才是有意思的地方

兩句都正確的話,還是可以蓋成不同的落點。把它們並排看:

  • 「世界第二」(xAI)是一個比它引用的那份排行榜更寬的框。它讀起來像是在陳述現實;把它收窄回某一天某一張圖表的,是那條註腳。
  • 「領先 Meta、Google 和 xAI 的領先模型」(微軟)點的是競爭對手,而不是一個數字。這比一個名次更可被證偽——也更容易過期,因為它剛好邀請了下一次發表就會推翻的那組比較。
  • 「文生圖和圖片編輯兩項上」(xAI)一次宣稱了兩份榜。微軟的宣稱只涵蓋一份。一個把兩則都快速掃過的讀者,合理地會得出 xAI 的結果比較寬的結論,而在 8 月 7 日那天確實如此。

這兩句都不是不誠實意義上的話術。它們都是發表文案在做發表文案該做的事:在為真的那幾種框法裡,挑最好看的那個。你身為讀者的工作,是察覺自己被遞到手上的是哪一個框。

小技巧

看到一則排行榜宣稱時,先找三件事,再決定要不要相信它跟你的使用情境有關:日期、是哪一份榜,以及那個數字是總體還是分類的。如果發表內容漏掉其中任何一件,在能查證之前就先把它當行銷話術看待。

還有一個陷阱:榜上的名字不一定是那家公司

xAI 自己的註腳裡有一個值得記住的細節:「xAI 的模型在 Arena 上是以 SpaceXAI 這個名字列出的。」

如果你為了查證而去排行榜上找 "xAI",你不會找到。這不是單一服務商特有的現象——模型會以實驗室名稱、內部代號,或測試期間的匿名別名出現,而你正在比較的某個模型,可能就掛在一個你認不出來的名字底下。一個你定位不到的名次,就是一個你無法查證的名次。

Arena Elo 到底在測什麼

Arena 這類排行榜跑的是盲測兩兩比較:一個人看到同一句提示詞的兩份輸出,不知道哪一份出自哪個模型,然後選一份。這些票餵給一套 Elo 評分,跟西洋棋用的是同一套機制。

這個設計有真正的強項。它很難用精挑細選的樣本作弊,它捕捉的是整體的人類偏好而不是某個代理指標,而且模型真的變好時它會動。微軟報告的 MAI-Image-2.6 相對 MAI-Image-2.5 的 +79 Elo,是一個有意義的訊號:在一組混合的提示詞上,人們比較偏好它的輸出。

它同時也有一些被單一名次藏起來的結構性特質:

  • 它是一個滾動的數字。 票進來,評分就持續更新。一個名次是一張截圖,不是模型的屬性。
  • 名次會壓縮距離。 第二和第三之間可能只差幾點 Elo——遠在信賴區間之內——也可能差一大截。序數本身完全不告訴你是哪一種。
  • 那組提示詞不是你的提示詞。 整體偏好是在投票族群剛好送出的那些東西上算出來的。如果你的工作是泰文包裝設計,那個族群幾乎沒有代表到你。
  • 偏好不等於適用。 投票者在幾秒鐘內、沒有需求說明的情況下,挑他們比較喜歡的那張圖。他們不會去檢查標誌有沒有活下來、一張臉有沒有重現,或文字在法律上是否正確。

一個名次告訴不了你的五件事

一個總體名次是真實的結果,卻是很差的採購依據。它不會告訴你:

  1. 它在你那個分類贏不贏。 人像、字體排印、產品和插畫,各自的領先者可能都不一樣。微軟把文字算繪單獨拆出來報告(+91 Elo),正是因為分類結果和總體結果會分岔。
  2. 它多少錢。 MAI-Image-2.5 的模型頁把「Image Arena Elo 對每千張圖片的代表性 API 價格」畫成一張圖——服務商自己就把每一塊錢的品質當成真正的軸。一個名次裡面沒有價格。
  3. 你用不用得到。 開放程度、API 存取、速率限制和商用條款,都跟品質是分開的。一個模型可以既是第二名,又對你不開放。
  4. 它怎麼壞。 兩個評分相同的模型,壞的方式可能完全相反——一個在長相上漂移,一個把小字弄爛。對你的流程來說,它們的失敗模式比平均值重要得多。
  5. 那個差距是不是真的。 沒有信賴區間,「第二」和「第四」在統計上可能分不出來。

注意

最常見的誤讀,是把名次當成耐久的東西。這篇文章裡的兩則宣稱在各自發佈那天都是正確的,其中至少一則在 72 小時內就過時了。任何引用排行榜名次卻不附日期的頁面,都是在跟你講過去的事,卻沒有講明白。

該用什麼取代它:你自己的驗收需求

排行榜是拿來拉入圍名單的合理方法,卻是拿來做最終決定的爛方法。取代它的做法很便宜,大約一小時就能做完。

寫一份代表你真實工作的需求,然後除了模型以外,其他全部固定住:

  1. 挑一件真正的工作,不是展示用的點子——你真的要出的那個包裝、真的會重複出現的那個角色、真的帶法律聲明那行字的那張海報。
  2. 先寫下通過/不通過的判準,在你看到任何輸出之前。「主標拼寫正確、層次撐得住、帶重音符號的字元算得出來」是可以檢查的。「看起來不錯」不行。
  3. 提示詞、參考圖、畫面比例和 Seed 在各個模型之間保持一致。 唯一的變數是模型。
  4. 每個模型生成好幾份輸出,不是一份。單一次的好運氣,跟一份發表用的作品集是同一種證據。
  5. 測你最怕的那種失敗。 如果你的風險在長相一致,就把同一張臉跑六次。如果在文字,就拿你最長的字串、用你最難的文字系統跑。
  6. 把結果連同日期寫下來。 你自己的筆記跟排行榜一樣會老,而你會想知道自己上次查是什麼時候。

這套流程回答的是一個名次答不出來的問題:這個模型在我需要的那件具體的事情上好不好,價格我付不付得起,就在今天?

想看一個把服務商宣稱對照公開證據來讀的實例,可以看我們對微軟公布的那四句提示詞的拆解,以及我們的 Grok Imagine Image 2.0 發表分析——這兩次發表正是本文的主角。想看版面和寫實感的當期正面對決,GPT Image 2 對 Nano Banana 2 比較的是兩個你今天就能跑的模型。

常見問題

Arena 排行榜是什麼?

Arena 是一個公開的評測平台,用盲測的兩兩人類偏好投票來替 AI 模型排名。同一句提示詞的兩份輸出在不顯示模型名稱的情況下並排呈現,由人挑一份,這些票再產生出 Elo 評分和序數排名。

兩個模型怎麼可能都是第二名?

因為評分是持續更新的,而每一則宣稱都是一張快照。xAI 的宣稱標的日期是 2026 年 8 月 7 日,微軟的則發佈於 2026 年 8 月 10 日。在這兩個日期之間,第二名換了手——微軟自己的發表內容,也因為把 xAI 列進它領先的對象裡而暗示了這件事。

Elo 是衡量圖片模型品質的好指標嗎?

它是衡量整體盲測人類偏好的好指標,那是一個真實而且不容易造假的訊號。它不是分類表現、成本、延遲、開放程度,或針對某一份具體需求的可靠度的指標,而且它標頭上的那個數字不帶信賴區間。

為什麼我在 Arena 排行榜上找不到 xAI?

xAI 在自己的發表內容裡註明,它的模型在 Arena 上是以 SpaceXAI 這個名字列出的。服務商經常以實驗室名稱或別名出現,所以某個模型可能掛在一個對不上你搜尋的那家公司的名字底下。

我該根據排行榜名次挑模型嗎?

用名次拉出入圍名單,然後用你自己的需求做決定。把同一組提示詞、參考素材、畫面比例和通過/不通過判準跑過兩三個候選,再拿你真的要交出去的作品去評判那些輸出。

一則排行榜宣稱能撐多久?

沒有固定答案,但這篇文章自己的例子三天就翻盤了。任何沒有日期的排名宣稱都當成歷史看待,而且在做出依賴它的決定之前重新查一次。

在 OmniArt 上開始

務實的做法是別再比較發表內容,開始比較輸出。打開 OmniArt 圖片工作台,拿一份你真的得交出去的需求,用完全相同的輸入和一份你事先寫好的通過/不通過清單,跑過兩個模型。

OmniArt 把圖片、影片、音訊和音樂模型放在同一個工作台裡,所以一份入圍名單會變成一次並排測試,而不是一個橫跨四個網站、四個帳單頁面的研究專案。等到下個月排行榜又翻一次——它一定會——你已經知道哪個模型做得了你的工作,而那才是唯一付得出錢來的排名。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始