IndustryModellen en inzichten10 min lezen

Arena-ranglijsten uitgelegd: twee keer plek 2 in drie dagen

Op 7 augustus zei xAI dat Imagine Image 2.0 tweede stond in de wereld. Op 10 augustus zei Microsoft dat MAI-Image-2.6 tweede stond op dezelfde ranglijst. Allebei spraken ze de waarheid — en dat leert je hoe je een ranglijst leest.

OmniArt-team
Arena-ranglijsten uitgelegd: twee keer plek 2 in drie dagen

Op 7 augustus 2026 kondigde xAI Imagine Image 2.0 aan en schreef erbij dat het model “wereldwijd tweede staat in zowel tekst-naar-beeldgeneratie als beeldbewerking”.

Op 10 augustus 2026 kondigde Microsoft MAI-Image-2.6 aan als “tweede op de Arena-ranglijst voor tekst-naar-beeld”, met de toevoeging dat het resultaat “MAI-Image stevig vóór de toonaangevende modellen van Meta, Google en xAI zet”.

Dezelfde ranglijst. Dezelfde positie. Drie dagen ertussen. Geen van beide bedrijven loog, en het gat tussen die twee zinnen is een van de nuttigste dingen die je dit jaar over modelevaluatie kunt leren — want bijna elke claim die je over een beeldmodel leest, heeft de vorm van een van deze twee.

Wat er in die drie dagen echt gebeurde

Aankondigingsbeeld van Microsoft AI: een grote 2 met een hekje, gevuld met kleine foto’s van natuur, dieren en mensen, over vervaagde tekst over renderen, beeld, modellering en kunst
Het eigen aankondigingsbeeld van Microsoft voor MAI-Image-2.6, gepubliceerd op 10 augustus 2026. Bron: microsoft.ai.

De twee aankondigingen beschrijven dezelfde ladder op twee verschillende momenten:

DatumModelDe gepubliceerde claim
7 augustusImagine Image 2.0 (xAI)“Staat wereldwijd tweede” in tekst-naar-beeld en beeldbewerking
10 augustusMAI-Image-2.6 (Microsoft)Tweede op de Arena-ranglijst voor tekst-naar-beeld; vóór Meta, Google en xAI

Gelezen als een opeenvolging in plaats van als een tegenspraak is het simpelweg een verschuiving: xAI hield plek twee op 7 augustus vast, Microsoft nam die vóór 10 augustus over. De formulering van Microsoft erkent de wisseling zelfs — xAI noemen tussen de modellen waar het nu vóór staat, is een specifiekere claim dan “wij zijn tweede”, en het is precies het stuk van de zin dat de andere claim dateert.

Beide bedrijven zetten er een eerlijke voetnoot bij. De grafiekvoetnoot van xAI luidt: “Overall Elo. Bron: de Arena-ranglijsten voor Image Edit en Text-to-Image (stand van 7 aug. 2026).” Die “stand van” doet echt werk, en de meeste lezers slaan hem over.

De formulering is het interessante deel

Twee correcte zinnen kunnen nog steeds zo gebouwd zijn dat ze anders landen. Zet ze naast elkaar:

  • “Tweede in de wereld” (xAI) is een breder kader dan de ranglijst waar het naar verwijst. Het leest als een uitspraak over de werkelijkheid; de voetnoot is wat het terugbrengt tot één specifieke grafiek op één specifieke dag.
  • “Vóór de toonaangevende modellen van Meta, Google en xAI” (Microsoft) noemt concurrenten in plaats van een getal. Dat is beter te weerleggen dan een positie — en ook bederfelijker, want het nodigt precies uit tot de vergelijking die de volgende release kapotmaakt.
  • “In zowel tekst-naar-beeldgeneratie als beeldbewerking” (xAI) claimt twee ranglijsten tegelijk. De claim van Microsoft dekt er één. Een lezer die beide vluchtig doorneemt, zou redelijkerwijs concluderen dat het resultaat van xAI het bredere was, en op 7 augustus was dat ook zo.

Geen van beide is spin in de oneerlijke zin. Het is allebei lanceringstekst die doet wat lanceringstekst doet: het ware kader kiezen dat het meest vleit. Jouw taak als lezer is opmerken welk kader je in handen is gedrukt.

Tip

Zoek bij elke ranglijstclaim eerst drie dingen op voordat je er iets over je eigen werk uit afleidt: de datum, de precieze ranglijst, en of het getal over het totaal of over één categorie gaat. Ontbreekt een van de drie in de aankondiging, behandel de claim dan als marketing tot je hem kunt controleren.

Nog een valkuil: de naam op de lijst hoeft niet het bedrijf te zijn

In de voetnoot van xAI staat een detail dat het waard is te onthouden: “De modellen van xAI staan op Arena vermeld onder SpaceXAI.”

Ga je de claim controleren door de ranglijst af te zoeken op “xAI”, dan vind je hem niet. Dit is niet uniek voor één aanbieder — modellen verschijnen onder labnamen, interne codenamen en geanonimiseerde aliassen tijdens het testen, en het model dat je vergelijkt kan onder een naam op de lijst staan die je niet herkent. Een positie die je niet kunt vinden, is een positie die je niet kunt verifiëren.

Wat Arena-Elo eigenlijk meet

Ranglijsten in Arena-stijl draaien blinde paarsgewijze vergelijkingen: iemand ziet twee resultaten van dezelfde prompt, zonder te weten welk model welk resultaat maakte, en kiest er één. Die stemmen voeden een Elo-score, hetzelfde mechanisme dat schaken gebruikt.

Dat ontwerp heeft echte sterke punten. Het is lastig te manipuleren met uitgekozen voorbeelden, het vangt de menselijke voorkeur in het totaal in plaats van een indirecte maat, en het beweegt wanneer een model daadwerkelijk beter wordt. De +79 Elo die Microsoft voor MAI-Image-2.6 boven MAI-Image-2.5 rapporteert, is een betekenisvol signaal dat mensen de output ervan prettiger vonden over een gemengde set prompts.

Het heeft ook structurele eigenschappen die één positie verbergt:

  • Het is een doorlopend getal. Scores worden continu geactualiseerd naarmate er stemmen binnenkomen. Een positie is een momentopname, geen eigenschap van het model.
  • Posities drukken afstanden samen. Tussen tweede en derde kan een handvol Elo-punten liggen — ruim binnen een betrouwbaarheidsinterval — of een groot gat. Het rangnummer zegt niets over welke van de twee.
  • De promptmix is niet jouw promptmix. De gemiddelde voorkeur wordt berekend over wat de stemmende populatie toevallig heeft ingediend. Werk jij aan verpakkingen in het Thai, dan vertegenwoordigde die populatie jou nauwelijks.
  • Voorkeur is geen geschiktheid. Stemmers kiezen binnen enkele seconden de afbeelding die ze mooier vinden, zonder briefing. Ze controleren niet of een logo intact bleef, of een gezicht herhaalbaar is, of de tekst juridisch klopt.

Vijf dingen die een positie je niet kan vertellen

Een positie in het totaal is een echt resultaat en een slechte aankoopbeslissing. Ze vertelt je niet:

  1. Of het model jouw categorie wint. Portret, typografie, product en illustratie kunnen elk een andere koploper hebben. Microsoft rapporteerde tekstweergave apart (+91 Elo) juist omdat categorieresultaten en totaalresultaten uiteenlopen.
  2. Wat het kost. De modelpagina van MAI-Image-2.5 zet “Image Arena Elo tegen een representatieve API-prijs per 1.000 afbeeldingen” in een grafiek — de aanbieder zelf behandelt kwaliteit-per-euro als de echte as. In een positie zit geen prijs.
  3. Of je het kunt gebruiken. Beschikbaarheid, API-toegang, limieten en commerciële voorwaarden staan los van kwaliteit. Een model kan tweede staan en voor jou onbereikbaar zijn.
  4. Hoe het faalt. Twee modellen met dezelfde score kunnen op tegengestelde manieren falen — het ene laat de identiteit wegdrijven, het andere verhaspelt kleine tekst. Hun faalgedrag telt zwaarder voor jouw pijplijn dan hun gemiddelde.
  5. Of het verschil echt is. Zonder betrouwbaarheidsintervallen kunnen “tweede” en “vierde” statistisch niet te onderscheiden zijn.

Waarschuwing

De meest gemaakte leesfout is een positie als duurzaam behandelen. Beide claims in dit artikel klopten op hun publicatiedatum, en minstens één was binnen 72 uur achterhaald. Elke pagina die een ranglijstpositie zonder datum citeert, vertelt je iets over het verleden zonder dat te zeggen.

Wat je in plaats daarvan gebruikt: je eigen acceptatiebriefing

Ranglijsten zijn een redelijke manier om een shortlist te maken en een slechte manier om de knoop door te hakken. Het alternatief is goedkoop en kost ongeveer een uur.

Schrijf één briefing die je echte werk vertegenwoordigt en houd daarna alles constant behalve het model:

  1. Kies één echte klus, geen etalagestuk — de verpakking die je echt levert, het personage dat echt terugkomt, de poster met de echte juridische regel.
  2. Schrijf de slagen-of-zakkencriteria eerst op, voordat je output ziet. “De kop is correct gespeld, de hiërarchie houdt stand en de letters met accenten renderen” is controleerbaar. “Ziet er goed uit” niet.
  3. Houd de prompt, de referentieafbeeldingen, de beeldverhouding en de Seed identiek over de modellen heen. De enige variabele is het model.
  4. Genereer meerdere resultaten per model, niet één. Eén gelukkig resultaat is net zoveel bewijs als een lanceringsgalerij.
  5. Test de fout waar je het bangst voor bent. Is identiteit je risico, draai hetzelfde gezicht dan zes keer. Is het tekst, draai dan je langste tekst in je lastigste schrift.
  6. Noteer het resultaat met een datum. Je eigen notitie veroudert net zo hard als een ranglijst, en je wilt weten wanneer je voor het laatst hebt gekeken.

Dat proces beantwoordt een vraag die een positie niet kan beantwoorden: is dit model goed in het specifieke ding dat ik nodig heb, tegen een prijs die ik kan betalen, vandaag?

Een uitgewerkt voorbeeld van aanbiedersclaims naast het gepubliceerde bewijsmateriaal lezen, staat in onze analyse van de vier prompts die Microsoft publiceerde en onze lanceringsanalyse van Grok Imagine Image 2.0 — de twee releases die in dit artikel centraal staan. Voor een actuele directe vergelijking op lay-out en fotorealisme zet GPT Image 2 tegenover Nano Banana 2 twee modellen naast elkaar die je vandaag kunt draaien.

Veelgestelde vragen

Wat is de Arena-ranglijst?

Arena is een openbaar evaluatieplatform dat AI-modellen rangschikt op basis van blinde paarsgewijze voorkeursstemmen van mensen. Twee resultaten van dezelfde prompt worden zonder modelnamen getoond, iemand kiest er één, en die stemmen leveren een Elo-score en een positie op.

Hoe kunnen twee modellen allebei tweede staan?

Omdat de scores continu worden geactualiseerd en elke claim een momentopname is. De claim van xAI was gedateerd op 7 augustus 2026 en die van Microsoft verscheen op 10 augustus 2026. Tussen die data wisselde de tweede plek van eigenaar, wat de aankondiging van Microsoft zelf impliceert door xAI te noemen tussen de modellen waar het vóór staat.

Is Elo een goede maat voor de kwaliteit van een beeldmodel?

Het is een goede maat voor blinde menselijke voorkeur in het totaal, en dat is een echt en moeilijk te vervalsen signaal. Het is geen maat voor prestaties per categorie, kosten, latentie, beschikbaarheid of betrouwbaarheid bij een specifieke briefing, en het getal in de kop draagt geen betrouwbaarheidsinterval.

Waarom kan ik xAI niet op de Arena-ranglijst vinden?

xAI merkt in zijn eigen aankondiging op dat zijn modellen op Arena onder de naam SpaceXAI staan. Aanbieders verschijnen vaak onder labnamen of aliassen, dus een model kan gerangschikt staan onder een naam die niet overeenkomt met het bedrijf waar je op zoekt.

Moet ik een model kiezen op basis van zijn ranglijstpositie?

Gebruik een positie om een shortlist te maken en beslis daarna met je eigen briefing. Draai dezelfde prompt, referenties, beeldverhouding en slagen-of-zakkencriteria over twee of drie kandidaten en beoordeel de output tegen het werk dat je echt levert.

Hoe lang is een ranglijstclaim geldig?

Er is geen vast antwoord, maar het voorbeeld in dit artikel was binnen drie dagen achterhaald. Behandel elke ongedateerde ranglijstclaim als geschiedenis en controleer opnieuw voordat je er een beslissing op baseert.

Aan de slag op OmniArt

De praktische zet is stoppen met aankondigingen vergelijken en beginnen met output vergelijken. Open de beeldwerkruimte van OmniArt, pak één briefing die je echt moet leveren en haal die door twee modellen met identieke invoer en een vooraf geschreven lijst met slagen-of-zakkencriteria.

OmniArt houdt beeld-, video-, audio- en muziekmodellen in één werkruimte, dus een shortlist wordt een test naast elkaar in plaats van een onderzoeksproject over vier sites en vier betaalpagina’s. Wanneer de ranglijst volgende maand opnieuw omdraait — en dat gebeurt — weet je al welk model jouw werk doet, en dat is de enige rangschikking die iets oplevert.

Klaar om te maken?

Ga aan de slag en genereer content met AI

Gratis aan de slag