Membaca peringkat Arena: dua klaim posisi dua dalam tiga hari
Pada 7 Agustus xAI menyebut Imagine Image 2.0 peringkat dua dunia. Pada 10 Agustus Microsoft menyebut MAI-Image-2.6 peringkat dua di papan yang sama. Keduanya berkata benar, dan justru di situlah pelajarannya.

Pada 7 Agustus 2026, xAI mengumumkan Imagine Image 2.0 dan menulis: "it ranks second in the world in both text-to-image generation and image editing."
Pada 10 Agustus 2026, Microsoft mengumumkan MAI-Image-2.6 sebagai "ranked second on the Arena text-to-image leaderboard", sambil menambahkan bahwa hasil itu "firmly establishes MAI-Image ahead of leading models from Meta, Google and xAI."
Papan yang sama, posisi yang sama, berjarak tiga hari. Tidak ada perusahaan yang berbohong. Dan jarak antara dua kalimat itu adalah salah satu hal paling berguna yang bisa Anda pelajari tahun ini tentang evaluasi model, karena hampir semua klaim tentang model gambar yang akan Anda baca berbentuk salah satu dari keduanya.
Apa yang sebenarnya terjadi dalam tiga hari itu

Kedua pengumuman menggambarkan tangga yang sama pada dua momen berbeda:
| Tanggal | Model | Klaim yang dipublikasikan |
|---|---|---|
| 7 Agustus | Imagine Image 2.0 (xAI) | Peringkat dua dunia untuk teks ke gambar dan penyuntingan gambar |
| 10 Agustus | MAI-Image-2.6 (Microsoft) | Peringkat dua di papan teks ke gambar Arena; unggul atas Meta, Google, dan xAI |
Dibaca sebagai urutan waktu alih-alih sebagai pertentangan, persoalannya jadi sederhana: pada 7 Agustus xAI memegang posisi dua, dan sampai 10 Agustus Microsoft mengambilnya. Rumusan Microsoft bahkan mengakui pergantian itu — menyebut xAI di antara model yang kini dilampaui adalah klaim yang lebih spesifik daripada mengatakan kami peringkat dua, dan justru penggalan itulah yang memberi tanggal pada klaim satunya.
Kedua perusahaan memberi catatan kaki dengan jujur. Catatan pada grafik xAI berbunyi: "Overall Elo. Source: Arena Image Edit and Text-to-Image leaderboards (as of Aug 7, 2026)." Frasa "as of" itu benar-benar bekerja, dan kebanyakan pembaca melewatinya.
Bagian yang menarik justru pilihan katanya
Dua kalimat yang sama-sama akurat tetap bisa disusun agar mendarat berbeda. Sandingkan keduanya:
- "Second in the world" (xAI) adalah bingkai yang lebih luas daripada papan yang dikutipnya. Kalimat itu terbaca seperti pernyataan tentang kenyataan; yang mempersempitnya kembali menjadi satu tabel pada satu hari tertentu adalah catatan kakinya.
- "Ahead of leading models from Meta, Google and xAI" (Microsoft) menyebut nama pesaing alih-alih angka. Klaim ini lebih mudah dibantah daripada sebuah peringkat, dan juga lebih cepat basi, karena ia mengundang tepat perbandingan yang akan dipatahkan rilis berikutnya.
- "On both text-to-image generation and image editing" (xAI) mengklaim dua papan sekaligus. Klaim Microsoft mencakup satu papan. Pembaca yang menyapu kedua pengumuman akan menyimpulkan secara wajar bahwa hasil xAI lebih luas, dan pada 7 Agustus memang begitu.
Tidak satu pun dari ini merupakan pemolesan dalam arti tidak jujur. Keduanya adalah teks peluncuran yang melakukan apa yang dilakukan teks peluncuran: memilih rumusan yang benar dan paling menguntungkan. Tugas Anda sebagai pembaca adalah menyadari bingkai mana yang disodorkan ke tangan Anda.
Tips
Ketika melihat klaim tentang papan peringkat, carilah tiga hal sebelum memercayai apa pun untuk kebutuhan Anda sendiri: tanggalnya, papan mana persisnya, dan apakah angka itu keseluruhan atau per kategori. Jika pengumuman menghilangkan salah satunya, perlakukan klaim itu sebagai materi pemasaran sampai bisa diperiksa.
Satu jebakan lagi: nama di papan bisa jadi bukan nama perusahaan
Catatan kaki xAI sendiri memuat detail yang layak diingat: "xAI models are listed on Arena under SpaceXAI."
Kalau Anda hendak memverifikasi klaim itu dengan menyisir papan mencari "xAI", Anda tidak akan menemukannya. Ini bukan keunikan satu penyedia saja — model muncul dengan nama lab, nama sandi internal, dan alias anonim selama pengujian, dan model yang sedang Anda bandingkan bisa jadi ada di sana dengan nama yang tidak Anda kenali. Peringkat yang tidak bisa Anda temukan adalah peringkat yang tidak bisa Anda verifikasi.
Apa yang sebenarnya diukur Elo Arena
Papan peringkat bergaya Arena menjalankan perbandingan berpasangan secara buta: seseorang melihat dua keluaran untuk prompt yang sama, tanpa tahu model mana membuat yang mana, lalu memilih satu. Suara-suara itu menghasilkan rating Elo, mekanisme yang sama dengan yang dipakai dalam catur.
Rancangan ini punya kekuatan nyata. Sulit diakali dengan sampel pilihan, ia menangkap preferensi manusia secara agregat alih-alih metrik pengganti, dan ia bergerak ketika sebuah model benar-benar membaik. Angka +79 Elo yang dilaporkan Microsoft untuk MAI-Image-2.6 dibanding MAI-Image-2.5 adalah sinyal bermakna bahwa orang lebih menyukai keluarannya pada satu set prompt campuran.
Ia juga punya sifat struktural yang tertutupi oleh satu peringkat:
- Ini angka yang terus bergulir. Rating diperbarui secara berkelanjutan seiring suara masuk. Peringkat adalah tangkapan layar, bukan sifat model.
- Peringkat memampatkan jarak. Posisi dua dan tiga bisa terpisah beberapa poin Elo saja, masih di dalam selang kepercayaan, atau terpisah jauh. Angka urutan tidak memberi tahu yang mana.
- Komposisi prompt bukan komposisi Anda. Preferensi agregat dihitung atas apa pun yang kebetulan dikirim populasi pemilih. Kalau pekerjaan Anda adalah kemasan berbahasa Thai, populasi itu nyaris tidak mewakili Anda.
- Preferensi bukan kecocokan. Pemilih memilih gambar yang lebih disukai dalam hitungan detik, tanpa brief di tangan. Mereka tidak memeriksa apakah logo bertahan, apakah wajah berulang, atau apakah teksnya benar secara hukum.
Lima hal yang tidak bisa diberitahukan sebuah peringkat
Posisi keseluruhan adalah hasil yang sungguhan sekaligus dasar keputusan pembelian yang buruk. Ia tidak akan memberi tahu Anda:
- Apakah ia menang di kategori Anda. Potret, tipografi, produk, dan ilustrasi bisa punya pemuncak berbeda. Microsoft memisahkan perenderan teks (+91 Elo) justru karena hasil per kategori dan hasil keseluruhan bisa berpencar.
- Berapa biayanya. Halaman model MAI-Image-2.5 menampilkan grafik "Image Arena Elo dibanding harga API representatif per 1.000 gambar" — penyedianya sendiri memperlakukan kualitas per rupiah sebagai sumbu yang sebenarnya. Di dalam peringkat tidak ada harga.
- Apakah Anda bisa memakainya. Ketersediaan, akses API, batas permintaan, dan ketentuan komersial terpisah dari kualitas. Sebuah model bisa berada di posisi dua sekaligus tidak tersedia untuk Anda.
- Bagaimana ia gagal. Dua model dengan rating sama bisa gagal dengan cara berlawanan: satu melenceng pada identitas, satu merusak teks kecil. Bagi alur produksi Anda, cara gagalnya lebih penting daripada rata-ratanya.
- Apakah selisihnya nyata. Tanpa selang kepercayaan, posisi dua dan posisi empat bisa saja tidak terbedakan secara statistik.
Peringatan
Salah baca yang paling umum adalah memperlakukan peringkat sebagai sesuatu yang awet. Kedua klaim dalam artikel ini akurat pada tanggal terbitnya masing-masing, dan setidaknya satu sudah usang dalam 72 jam. Halaman mana pun yang mengutip posisi papan peringkat tanpa tanggal sedang bercerita tentang masa lalu tanpa mengatakannya.
Apa yang dipakai sebagai gantinya: brief penerimaan Anda sendiri
Papan peringkat masuk akal untuk menyusun daftar pendek dan buruk untuk mengambil keputusan akhir. Penggantinya murah dan memakan waktu sekitar satu jam.
Tulis satu brief yang mewakili pekerjaan Anda yang sebenarnya, lalu tahan semuanya tetap kecuali modelnya:
- Ambil satu pekerjaan nyata, bukan ide pajangan — kemasan yang benar-benar Anda kirim, karakter yang benar-benar berulang, poster dengan baris legal yang sungguhan.
- Tulis kriteria lulus dan tidak lulus lebih dulu, sebelum melihat keluaran apa pun. Kalimat bahwa judul dieja benar, hierarki bertahan, dan karakter beraksen muncul itu bisa diperiksa. Kalimat kelihatannya bagus tidak bisa.
- Jaga prompt, gambar referensi, rasio aspek, dan seed tetap identik di semua model. Satu-satunya variabel adalah modelnya.
- Buat beberapa keluaran per model, bukan satu. Satu hasil yang kebetulan bagus adalah bukti dengan kualitas yang sama seperti galeri halaman peluncuran.
- Uji kegagalan yang paling Anda takuti. Kalau risikonya identitas, jalankan wajah yang sama enam kali. Kalau risikonya teks, pakai string terpanjang dalam aksara tersulit yang Anda punya.
- Catat hasilnya beserta tanggal. Catatan Anda sendiri menua sama seperti papan peringkat, dan Anda akan ingin tahu kapan terakhir memeriksanya.
Proses ini menjawab pertanyaan yang tidak bisa dijawab sebuah peringkat: apakah model ini bagus pada hal spesifik yang saya butuhkan, dengan harga yang sanggup saya bayar, hari ini?
Untuk contoh terperinci membaca klaim penyedia terhadap bukti yang dipublikasikan, lihat pembahasan kami tentang empat prompt yang diterbitkan Microsoft dan analisis peluncuran Grok Imagine Image 2.0 — dua peluncuran yang menjadi pusat artikel ini. Untuk adu langsung terbaru soal tata letak dan fotorealisme, GPT Image 2 versus Nano Banana 2 membandingkan dua model yang bisa Anda jalankan hari ini.
Pertanyaan yang sering diajukan
Apa itu papan peringkat Arena?
Arena adalah platform evaluasi publik yang memeringkat model AI menggunakan suara preferensi manusia secara berpasangan dan buta. Dua keluaran untuk prompt yang sama ditampilkan tanpa nama model, seseorang memilih satu, dan suara-suara itu menghasilkan rating Elo serta peringkat urutan.
Bagaimana dua model bisa sama-sama berada di posisi dua?
Karena rating diperbarui terus-menerus dan setiap klaim adalah potret sesaat. Klaim xAI bertanggal 7 Agustus 2026 dan pengumuman Microsoft terbit 10 Agustus 2026. Di antara kedua tanggal itu posisi dua berpindah tangan, hal yang disiratkan sendiri oleh pengumuman Microsoft ketika menyebut xAI di antara model yang dilampaui.
Apakah Elo ukuran yang baik untuk kualitas model gambar?
Ia ukuran yang baik untuk preferensi manusia secara agregat dalam kondisi buta, dan itu sinyal nyata yang sulit dipalsukan. Ia bukan ukuran performa per kategori, biaya, latensi, ketersediaan, atau keandalan pada brief tertentu, dan angka utamanya tidak disertai selang kepercayaan.
Kenapa saya tidak menemukan xAI di papan peringkat Arena?
xAI mencatat dalam pengumumannya sendiri bahwa model mereka terdaftar di Arena dengan nama SpaceXAI. Penyedia kerap muncul dengan nama lab atau alias, sehingga sebuah model bisa diperingkat dengan nama yang tidak cocok dengan perusahaan yang Anda cari.
Haruskah saya memilih model berdasarkan peringkatnya?
Gunakan peringkat untuk menyusun daftar pendek, lalu putuskan dengan brief Anda sendiri. Jalankan prompt, referensi, rasio aspek, dan kriteria kelulusan yang sama pada dua atau tiga kandidat, dan nilai keluarannya terhadap pekerjaan yang benar-benar Anda kirimkan.
Berapa lama sebuah klaim papan peringkat berlaku?
Tidak ada jawaban pasti, tetapi contoh dalam artikel ini berbalik dalam tiga hari. Perlakukan klaim peringkat tanpa tanggal sebagai informasi masa lalu, dan periksa ulang sebelum mengambil keputusan yang bergantung padanya.
Memulai di OmniArt
Langkah praktisnya adalah berhenti membandingkan pengumuman dan mulai membandingkan keluaran. Buka ruang kerja gambar OmniArt, ambil satu brief yang memang harus Anda kirimkan, lalu jalankan melalui dua model dengan masukan identik dan daftar kriteria yang Anda tulis lebih dulu.
OmniArt menyatukan model gambar, video, audio, dan musik dalam satu ruang kerja, sehingga daftar pendek berubah menjadi pengujian berdampingan alih-alih proyek riset yang tersebar di empat situs dan empat halaman tagihan. Ketika papan peringkat berbalik lagi bulan depan — dan itu pasti terjadi — Anda sudah tahu model mana yang menyelesaikan pekerjaan Anda, dan itulah satu-satunya peringkat yang menghasilkan.
Siap membuat?
Mulai membuat konten menakjubkan dengan AI