Arena sıralamalarını okumak: üç günde iki ikincilik iddiası
7 Ağustos'ta xAI, Imagine Image 2.0'ın dünyada ikinci olduğunu söyledi. 10 Ağustos'ta Microsoft, MAI-Image-2.6'nın aynı sıralamada ikinci olduğunu söyledi. İkisi de doğruyu söylüyordu ve asıl ders tam burada.

7 Ağustos 2026'da xAI, Imagine Image 2.0'ı duyururken şunu yazdı: "it ranks second in the world in both text-to-image generation and image editing."
10 Ağustos 2026'da Microsoft, MAI-Image-2.6'yı "ranked second on the Arena text-to-image leaderboard" diye duyurdu ve bu sonucun "firmly establishes MAI-Image ahead of leading models from Meta, Google and xAI." olduğunu ekledi.
Aynı sıralama, aynı basamak, arada üç gün. İki şirket de yalan söylemedi. Bu iki cümle arasındaki mesafe ise model değerlendirmesi konusunda bu yıl öğrenebileceğiniz en işe yarar şeylerden biri, çünkü bir görsel modeli hakkında okuyacağınız neredeyse her iddia bu ikisinden birinin biçiminde geliyor.
O üç günde gerçekte ne oldu

İki duyuru aynı merdiveni iki farklı anda tarif ediyor:
| Tarih | Model | Yayımlanan iddia |
|---|---|---|
| 7 Ağustos | Imagine Image 2.0 (xAI) | Hem metinden görsele hem de görsel düzenlemede dünyada ikinci |
| 10 Ağustos | MAI-Image-2.6 (Microsoft) | Arena metinden görsele sıralamasında ikinci; Meta, Google ve xAI'ın önünde |
Bunu çelişki olarak değil sıra olarak okuduğunuzda mesele basitleşiyor: 7 Ağustos'ta ikincilik xAI'daydı, 10 Ağustos'a gelindiğinde Microsoft aldı. Microsoft'un ifadesi bu devri zaten kabul ediyor. Geçtiği modeller arasında xAI'ı adıyla anmak, biz ikinciyiz demekten daha belirli bir iddiadır ve öteki iddiaya tarih düşen tam da bu cümle parçasıdır.
İki şirket de dipnotu dürüstçe koymuş. xAI'ın grafik notu şöyle: "Overall Elo. Source: Arena Image Edit and Text-to-Image leaderboards (as of Aug 7, 2026)." Buradaki "as of" gerçek bir iş görüyor ama okurların çoğu onu atlıyor.
Asıl ilginç olan, kurulan cümle
İkisi de doğru olan iki cümle yine de farklı yerlere düşecek biçimde kurulabilir. Yan yana koyalım:
- "Second in the world" (xAI), alıntıladığı sıralamadan daha geniş bir çerçeve. Gerçekliğe dair bir saptama gibi okunuyor; onu belirli bir günün belirli bir tablosuna geri daraltan şey dipnot.
- "Ahead of leading models from Meta, Google and xAI" (Microsoft), sayı yerine rakip adı veriyor. Bir sıradan daha çürütülebilir, dolayısıyla daha çabuk bozulur, çünkü bir sonraki sürümün kıracağı karşılaştırmayı kendisi davet ediyor.
- "On both text-to-image generation and image editing" (xAI) tek seferde iki tabloyu birden öne sürüyor. Microsoft'un iddiası bir tabloyu kapsıyor. İki duyuruya göz gezdiren biri xAI'ın sonucunun daha geniş olduğuna makul biçimde kanaat getirir ve 7 Ağustos'ta gerçekten öyleydi.
Bunların hiçbiri dürüst olmayan anlamda cilalama değil. İkisi de lansman metninin yaptığı şeyi yapıyor: doğru olan anlatımlar arasından en yüz güldürücü olanı seçmek. Okur olarak sizin işiniz, elinize hangi çerçevenin tutuşturulduğunu fark etmek.
İpucu
Bir sıralama iddiası gördüğünüzde, kendi işiniz açısından ona bir şey yüklemeden önce üç şeyi arayın: tarihi, tam olarak hangi tablo olduğunu ve sayının genel mi yoksa kategori bazlı mı olduğunu. Duyuruda bunlardan biri bile eksikse, doğrulanana kadar iddiayı pazarlama metni sayın.
Bir tuzak daha: tablodaki ad şirketin adı olmayabilir
xAI'ın kendi dipnotunda akılda tutulmaya değer bir ayrıntı var: "xAI models are listed on Arena under SpaceXAI."
İddiayı doğrulamak için sıralamada xAI diye arattığınızda bulamazsınız. Bu tek bir sağlayıcıya özgü değil. Modeller laboratuvar adlarıyla, iç kod adlarıyla ve test sürecinde anonim takma adlarla listelenebiliyor, karşılaştırdığınız model tabloda tanımadığınız bir adla duruyor olabilir. Bulamadığınız bir sıra, doğrulayamadığınız bir sıradır.
Arena Elo aslında neyi ölçüyor
Arena tipi sıralamalar kör ikili karşılaştırma yürütür: bir kişi aynı prompt için iki çıktıyı, hangisini hangi modelin ürettiğini bilmeden görür ve birini seçer. Bu oylar bir Elo puanına dönüşür; satrançta kullanılan mekanizmanın aynısıdır.
Bu tasarımın gerçek güçlü yanları var. Seçilmiş örneklerle kandırmak zordur, vekil bir ölçüt yerine toplu insan tercihini yakalar ve model gerçekten iyileştiğinde kıpırdar. Microsoft'un MAI-Image-2.5'e göre MAI-Image-2.6 için bildirdiği +79 Elo, karışık bir prompt kümesinde insanların onun çıktılarını tercih ettiğine dair anlamlı bir sinyaldir.
Bununla birlikte tek bir sıranın örttüğü yapısal özellikleri de var:
- Bu, akıp giden bir sayıdır. Oylar geldikçe puanlar sürekli güncellenir. Sıra bir ekran görüntüsüdür, modelin özelliği değil.
- Sıralar mesafeyi ezer. İkinci ile üçüncü arasında bir avuç Elo puanı, yani güven aralığının içinde kalan bir fark olabilir; ya da geniş bir açıklık. Sıra sayısı hangisi olduğunu söylemez.
- Prompt bileşimi sizin bileşiminiz değil. Toplu tercih, oy veren kitlenin gönderdiği her neyse onun üzerinden hesaplanır. İşiniz Tayca ambalajsa, o kitle sizi neredeyse hiç temsil etmemiştir.
- Tercih uygunluk demek değildir. Oy verenler birkaç saniyede daha çok beğendikleri görseli seçer, ellerinde brief yoktur. Logonun korunup korunmadığını, yüzün tekrarlanıp tekrarlanmadığını ya da metnin hukuken doğru olup olmadığını denetlemezler.
Bir sıranın size söyleyemeyeceği beş şey
Genel bir derece gerçek bir sonuçtur ve kötü bir satın alma gerekçesidir. Size şunları söylemez:
- Sizin kategorinizde kazanıp kazanmadığını. Portre, tipografi, ürün ve illüstrasyonun lideri farklı olabilir. Microsoft'un metin işlemeyi ayrı vermesinin (+91 Elo) sebebi tam olarak kategori sonuçlarıyla genel sonucun ayrışmasıdır.
- Kaça mal olduğunu. MAI-Image-2.5 model sayfası "Image Arena Elo'ya karşılık 1.000 görsel başına temsili API fiyatı" grafiğini çiziyor; sağlayıcının kendisi bile asıl ekseni para başına kalite olarak görüyor. Bir sıranın içinde fiyat yoktur.
- Kullanıp kullanamayacağınızı. Erişilebilirlik, API erişimi, istek limitleri ve ticari koşullar kaliteden ayrıdır. Bir model hem ikinci olabilir hem de size kapalı olabilir.
- Nasıl bozulduğunu. Aynı puana sahip iki model zıt biçimlerde başarısız olabilir: biri kimlikte kayar, öteki küçük metni ezer. Üretim hattınız için bozulma biçimi ortalamadan daha önemlidir.
- Aradaki farkın gerçek olup olmadığını. Güven aralıkları olmadan ikinci ile dördüncü istatistiksel olarak ayırt edilemeyebilir.
Uyarı
En yaygın yanlış okuma, bir sırayı kalıcı bir olgu gibi ele almaktır. Bu yazıdaki iki iddia da kendi yayın tarihlerinde doğruydu ve en az biri 72 saat içinde eskidi. Tarih vermeden sıralama derecesi aktaran her sayfa, size geçmişten söz ettiğini söylemeden geçmişten söz ediyordur.
Yerine ne koymalı: kendi kabul brief'iniz
Sıralamalar kısa liste çıkarmak için makul, nihai kararı vermek için kötüdür. Yerine koyacağınız yöntem ucuzdur ve yaklaşık bir saat sürer.
Gerçek işinizi temsil eden tek bir brief yazın, sonra model dışındaki her şeyi sabitleyin:
- Gerçek bir iş seçin, vitrinlik bir fikir değil: gerçekten teslim ettiğiniz ambalaj, gerçekten tekrar eden karakter, gerçek yasal satırı taşıyan afiş.
- Geçti ve kaldı ölçütlerini önce yazın, herhangi bir çıktı görmeden önce. Başlık doğru yazılmış, hiyerarşi ayakta, aksanlı karakterler çıkmış cümlesi denetlenebilir. Güzel görünüyor denetlenemez.
- Prompt, referans görselleri, en boy oranı ve seed değerini modeller arasında birebir aynı tutun. Tek değişken modeldir.
- Model başına birkaç çıktı üretin, tek çıktı değil. Şans eseri gelen tek bir sonuç, lansman galerisiyle aynı türden kanıttır.
- En çok korktuğunuz hatayı sınayın. Risk kimlikse aynı yüzü altı kez üretin. Risk metinse en zor yazı sisteminizdeki en uzun diziyi çalıştırın.
- Sonucu tarihiyle birlikte not edin. Kendi notunuz da sıralama gibi eskir ve en son ne zaman baktığınızı bilmek isteyeceksiniz.
Bu süreç, bir sıranın yanıtlayamadığı soruyu yanıtlar: bu model tam olarak benim ihtiyacım olan işte, ödeyebileceğim bir fiyata, bugün yeterince iyi mi?
Sağlayıcı iddialarını yayımlanmış kanıtlarla karşılaştırarak okumanın işlenmiş bir örneği için Microsoft'un yayımladığı dört prompt çözümlememize ve Grok Imagine Image 2.0 lansman analizimize bakın; bu yazının merkezindeki iki sürüm bunlar. Yerleşim ve fotogerçekçilik üzerine güncel bir karşılaştırma isterseniz GPT Image 2 ile Nano Banana 2 bugün kullanabileceğiniz iki modeli karşılaştırıyor.
Sık sorulan sorular
Arena sıralaması nedir?
Arena, yapay zeka modellerini kör ikili insan tercihi oylarıyla sıralayan açık bir değerlendirme platformudur. Aynı prompt için iki çıktı model adı gösterilmeden sunulur, bir kişi birini seçer ve bu oylardan bir Elo puanı ile sıra numarası çıkar.
İki model nasıl birden ikinci olabilir?
Puanlar sürekli güncellendiği ve her iddia bir anlık görüntü olduğu için. xAI'ın iddiası 7 Ağustos 2026 tarihliydi, Microsoft'un duyurusu 10 Ağustos 2026'da yayımlandı. Bu tarihler arasında ikincilik el değiştirdi; Microsoft'un kendi duyurusu da geçtiği modeller arasında xAI'ı anarak bunu ima ediyor.
Elo, görsel modeli kalitesi için iyi bir ölçüt mü?
Kör koşulda toplu insan tercihini ölçmek için iyi bir ölçüttür ve bu gerçek, taklidi zor bir sinyaldir. Ancak kategori bazlı performansı, maliyeti, gecikmeyi, erişilebilirliği veya belirli bir brief üzerindeki güvenilirliği ölçmez ve manşetteki sayı güven aralığı taşımaz.
Arena sıralamasında xAI'ı neden bulamıyorum?
xAI kendi duyurusunda modellerinin Arena'da SpaceXAI adıyla listelendiğini belirtiyor. Sağlayıcılar sıklıkla laboratuvar adları veya takma adlarla göründüğü için bir model, aradığınız şirket adıyla eşleşmeyen bir ad altında sıralanmış olabilir.
Modeli sıralamadaki derecesine göre mi seçmeliyim?
Dereceyi kısa liste çıkarmak için kullanın, kararı kendi brief'inizle verin. Aynı promptu, aynı referansları, aynı en boy oranını ve aynı ölçütleri iki üç adaya uygulayın ve çıktıları gerçekten teslim ettiğiniz işe göre değerlendirin.
Bir sıralama iddiası ne kadar süre geçerlidir?
Sabit bir yanıt yok ama bu yazıdaki örnek üç günde tersine döndü. Tarihsiz her sıralama iddiasını geçmişe ait bilgi sayın ve ona dayanan bir karar vermeden önce yeniden doğrulayın.
OmniArt'ta başlayın
Pratik hamle, duyuruları karşılaştırmayı bırakıp çıktıları karşılaştırmaya başlamaktır. OmniArt görsel çalışma alanını açın, gerçekten teslim etmeniz gereken bir brief alın ve aynı girdilerle, önceden yazdığınız bir ölçüt listesiyle iki modelden geçirin.
OmniArt görsel, video, ses ve müzik modellerini tek bir çalışma alanında tuttuğu için kısa liste, dört siteye ve dört fatura sayfasına yayılan bir araştırma projesi olmaktan çıkıp yan yana bir sınamaya dönüşür. Sıralama gelecek ay yeniden değiştiğinde — ki değişecek — hangi modelin sizin işinizi gördüğünü zaten biliyor olacaksınız. Kazandıran tek sıralama da budur.
Üretmeye hazır mısınız?
AI ile harika içerikler üretmeye başlayın