Industry모델 및 인사이트19분 읽기

Arena 순위 읽는 법: 사흘 사이 두 번의 2위 선언

8월 7일 xAI는 Imagine Image 2.0이 세계 2위라고 했습니다. 8월 10일 마이크로소프트는 MAI-Image-2.6이 같은 리더보드에서 2위라고 했습니다. 둘 다 사실이었고, 바로 그 점이 순위 읽는 법을 알려 줍니다.

OmniArt 팀
Arena 순위 읽는 법: 사흘 사이 두 번의 2위 선언

2026년 8월 7일, xAI는 Imagine Image 2.0을 발표하면서 "it ranks second in the world in both text-to-image generation and image editing."이라고 썼습니다.

2026년 8월 10일, 마이크로소프트는 MAI-Image-2.6을 "ranked second on the Arena text-to-image leaderboard"라고 발표하면서, 이 결과가 "firmly establishes MAI-Image ahead of leading models from Meta, Google and xAI."라고 덧붙였습니다.

같은 리더보드, 같은 자리, 간격은 사흘. 두 회사 모두 거짓말을 하지 않았습니다. 그리고 이 두 문장 사이의 간극은 올해 모델 평가에 대해 배울 수 있는 가장 쓸모 있는 것 중 하나입니다. 앞으로 읽게 될 이미지 모델 관련 주장의 거의 전부가 둘 중 하나의 형태를 하고 있기 때문입니다.

그 사흘 동안 실제로 일어난 일

마이크로소프트 AI의 발표용 그래픽. 해시 기호와 함께 있는 커다란 숫자 2 안에 자연·동물·인물 사진이 채워져 있고, 렌더링과 이미징, 모델링, 아트에 관한 흐릿한 글자 위에 얹혀 있습니다
마이크로소프트가 MAI-Image-2.6 발표를 위해 만든 그래픽. 2026년 8월 10일 공개. 출처: microsoft.ai.

두 발표는 같은 사다리의 서로 다른 시점을 묘사합니다.

날짜모델공개된 주장
8월 7일Imagine Image 2.0(xAI)텍스트-이미지 변환 이미지 편집 모두에서 세계 2위
8월 10일MAI-Image-2.6(마이크로소프트)Arena 텍스트-이미지 변환 2위. Meta·Google·xAI보다 앞섬

모순이 아니라 순서로 읽으면 이야기는 단순합니다. 8월 7일에는 xAI가 2위를 지키고 있었고, 8월 10일까지 마이크로소프트가 그 자리를 가져갔습니다. 마이크로소프트의 문장은 이 교대를 인정하기도 합니다. 앞섰다고 지목한 상대로 xAI를 호명한 것은 '우리가 2위다'보다 구체적인 주장이고, 그 한 문장이 다른 쪽 주장에 날짜를 붙여 줍니다.

각주는 양쪽 다 정직합니다. xAI의 차트 주석에는 "Overall Elo. Source: Arena Image Edit and Text-to-Image leaderboards (as of Aug 7, 2026)."라고 적혀 있습니다. 이 "as of"는 실제로 일을 하는 표현인데, 대부분의 독자는 그냥 지나칩니다.

흥미로운 지점은 표현입니다

둘 다 정확한 문장이라도 착지점이 다르게 만들어질 수 있습니다. 나란히 놓아 보겠습니다.

  • "Second in the world"(xAI)는 인용한 리더보드보다 큰 틀입니다. 현실에 대한 진술처럼 읽히고, 그것을 특정 날짜의 특정 표로 좁혀 주는 것은 각주 쪽입니다.
  • "Ahead of leading models from Meta, Google and xAI"(마이크로소프트)는 숫자가 아니라 경쟁자를 지목합니다. 순위보다 반증하기 쉽고, 그만큼 빨리 상합니다. 다음 릴리스가 깨뜨릴 바로 그 비교를 스스로 불러들이기 때문입니다.
  • "On both text-to-image generation and image editing"(xAI)은 두 보드를 한꺼번에 주장합니다. 마이크로소프트의 주장은 하나만 다룹니다. 둘을 훑어본 독자가 xAI의 결과가 더 넓다고 받아들이는 것은 합리적이고, 8월 7일에는 실제로 그랬습니다.

어느 쪽도 부정직한 의미의 포장은 아닙니다. 둘 다 발표 문구가 발표 문구답게 행동한 것뿐입니다. 참인 표현들 가운데 가장 보기 좋은 것을 고른 것이죠. 독자의 몫은 자기가 어느 틀을 건네받았는지 알아차리는 일입니다.

리더보드 주장을 보면, 그것이 내 용도에 의미가 있다고 믿기 전에 세 가지를 먼저 찾으세요. 날짜, 정확히 어떤 보드인지, 그리고 그 숫자가 종합인지 카테고리별인지. 발표에서 셋 중 하나라도 빠져 있다면 확인될 때까지는 마케팅 문구로 취급하십시오.

함정 하나 더: 보드에 적힌 이름이 회사 이름이 아닐 수 있습니다

xAI의 각주에는 기억해 둘 만한 문장이 있습니다. "xAI models are listed on Arena under SpaceXAI."

이 주장을 확인하려고 리더보드에서 xAI를 찾으면 나오지 않습니다. 특정 업체만의 이야기가 아닙니다. 모델은 연구소 이름이나 내부 코드명, 테스트 중의 익명 별칭으로 올라오기도 하고, 비교하려는 모델이 낯선 이름으로 등재되어 있을 수도 있습니다. 찾을 수 없는 순위는 검증할 수 없는 순위입니다.

Arena Elo가 실제로 재는 것

Arena류 리더보드는 블라인드 일대일 비교를 돌립니다. 한 사람이 같은 프롬프트에 대한 두 결과물을 어느 모델인지 모른 채 보고 하나를 고릅니다. 그 표들이 Elo 레이팅으로 모입니다. 체스에서 쓰는 것과 같은 방식입니다.

이 설계에는 분명한 장점이 있습니다. 엄선한 샘플로 속이기 어렵고, 대리 지표가 아니라 사람들의 종합적인 선호를 포착하며, 모델이 실제로 좋아지면 숫자가 움직입니다. 마이크로소프트가 밝힌 MAI-Image-2.5 대비 +79 Elo는 섞인 프롬프트 집합에서 사람들이 그 결과물을 더 선호했다는 의미 있는 신호입니다.

동시에 하나의 순위가 가려 버리는 구조적 특성도 있습니다.

  • 이것은 계속 움직이는 숫자입니다. 표가 들어올 때마다 레이팅이 갱신됩니다. 순위는 모델의 속성이 아니라 스크린숏입니다.
  • 순위는 거리를 뭉갭니다. 2위와 3위가 Elo 몇 점 차이, 즉 신뢰구간 안쪽일 수도 있고 크게 벌어져 있을 수도 있습니다. 서수는 어느 쪽인지 알려 주지 않습니다.
  • 프롬프트 구성은 당신의 구성이 아닙니다. 종합 선호는 투표자들이 마침 제출한 내용 위에서 계산됩니다. 당신의 작업이 태국어 패키지라면 그 모집단은 당신을 거의 대표하지 않습니다.
  • 선호는 적합성이 아닙니다. 투표자는 몇 초 안에 더 마음에 드는 쪽을 고릅니다. 손에 요구사항이 없습니다. 로고가 유지됐는지, 얼굴이 반복되는지, 문구가 법적으로 정확한지 확인하지 않습니다.

순위가 알려 주지 못하는 다섯 가지

종합 순위는 진짜 성과이면서 형편없는 구매 근거입니다. 다음은 알려 주지 못합니다.

  1. 내 카테고리에서 앞서는지. 인물, 타이포그래피, 제품, 일러스트는 각각 선두가 다를 수 있습니다. 마이크로소프트가 텍스트 렌더링을 따로 떼어 낸(+91 Elo) 이유가 바로 카테고리별과 종합이 갈리기 때문입니다.
  2. 얼마인지. MAI-Image-2.5 모델 페이지는 '이미지 Arena Elo 대 1,000장당 대표 API 가격'을 그립니다. 제공사 스스로 비용당 품질을 진짜 축으로 다루고 있는 셈입니다. 순위에는 가격이 들어 있지 않습니다.
  3. 쓸 수 있는지. 제공 여부, API 접근, 요청 한도, 상업 약관은 품질과 별개입니다. 2위이면서 당신에게는 쓸 수 없는 모델일 수 있습니다.
  4. 어떻게 망가지는지. 레이팅이 같은 두 모델이 정반대로 실패할 수 있습니다. 하나는 동일성이 흔들리고 하나는 작은 글자를 뭉갭니다. 파이프라인에는 평균보다 실패 방식이 더 중요합니다.
  5. 그 격차가 실재하는지. 신뢰구간이 없으면 2위와 4위가 통계적으로 구별되지 않을 수도 있습니다.

경고

가장 흔한 오독은 순위를 오래가는 사실로 취급하는 것입니다. 이 글의 두 주장은 각자의 공개일 기준으로 정확했고, 그중 최소 하나는 72시간 안에 낡았습니다. 날짜 없이 리더보드 순위를 인용하는 페이지는 그렇다고 말하지 않은 채 과거를 이야기하고 있는 것입니다.

대신 쓸 것: 나만의 합격 기준

리더보드는 후보를 추리는 데는 합당하고 최종 결정을 내리는 데는 부적합합니다. 대안은 저렴하고 한 시간이면 됩니다.

내 실제 업무를 대표하는 요구사항을 하나 쓰고, 모델을 제외한 모든 것을 고정하십시오.

  1. 진짜 일감을 하나 고릅니다. 전시용 아이디어가 아니라 실제로 출고할 패키지, 실제로 반복 등장하는 캐릭터, 실제 법적 문구가 들어간 포스터입니다.
  2. 합격·불합격 기준을 먼저 씁니다. 결과물을 보기 전에 씁니다. '헤드라인 철자가 맞고, 위계가 유지되고, 악센트 문자가 나온다'는 확인할 수 있습니다. '괜찮아 보인다'는 확인할 수 없습니다.
  3. 프롬프트, 참조 이미지, 화면비, 시드를 모델 간에 동일하게 유지합니다. 변수는 모델 하나뿐입니다.
  4. 모델당 여러 장을 생성합니다. 운 좋은 한 장은 출시 페이지 갤러리와 같은 종류의 증거일 뿐입니다.
  5. 가장 두려운 실패를 시험합니다. 위험이 동일성이면 같은 얼굴을 여섯 번, 텍스트면 가장 어려운 문자 체계로 가장 긴 문자열을 돌립니다.
  6. 결과를 날짜와 함께 적어 둡니다. 내 메모도 리더보드처럼 낡고, 마지막으로 확인한 시점이 궁금해질 것입니다.

이 절차는 순위가 답하지 못하는 질문에 답합니다. 이 모델은 내가 필요로 하는 구체적인 일에서, 내가 낼 수 있는 가격에, 오늘 충분히 좋은가.

제공사의 주장을 공개 자료와 맞대어 읽는 사례로는 마이크로소프트가 공개한 네 개의 프롬프트 분석과 Grok Imagine Image 2.0 출시 분석을 보세요. 이 글의 중심에 있는 두 출시입니다. 레이아웃과 사실감의 최신 맞대결은 GPT Image 2와 Nano Banana 2 비교가 오늘 쓸 수 있는 두 모델을 비교합니다.

자주 묻는 질문

Arena 리더보드란 무엇인가요?

Arena는 블라인드 일대일 인간 선호 투표로 AI 모델의 순위를 매기는 공개 평가 플랫폼입니다. 같은 프롬프트에 대한 두 결과물이 모델명 없이 제시되고, 사람이 하나를 고르며, 그 표들이 Elo 레이팅과 서수 순위를 만듭니다.

두 모델이 모두 2위일 수 있나요?

있습니다. 레이팅이 계속 갱신되고 각 주장이 스냅숏이기 때문입니다. xAI의 주장은 2026년 8월 7일 기준이고 마이크로소프트의 발표는 2026년 8월 10일입니다. 그 사이에 2위 자리가 바뀌었다는 것은, 앞섰다고 지목한 상대로 xAI를 호명한 마이크로소프트 자신의 발표가 시사합니다.

Elo는 이미지 모델 품질의 좋은 지표인가요?

블라인드 상태에서의 종합적인 인간 선호를 재는 지표로는 좋습니다. 실재하고 조작하기 어려운 신호입니다. 다만 카테고리별 성능, 비용, 지연 시간, 제공 여부, 특정 요구사항에서의 신뢰성을 재지는 않으며, 헤드라인 숫자에는 신뢰구간이 붙어 있지 않습니다.

Arena 리더보드에서 xAI를 왜 못 찾나요?

xAI는 자사 발표에서 자사 모델이 Arena에 SpaceXAI라는 이름으로 등재되어 있다고 밝혔습니다. 제공사가 연구소 이름이나 별칭으로 올라오는 일은 흔해서, 찾는 회사명과 다른 이름으로 순위가 매겨져 있을 수 있습니다.

리더보드 순위로 모델을 골라야 하나요?

순위는 후보를 추리는 데 쓰고, 결정은 내 요구사항으로 내리세요. 같은 프롬프트, 참조 이미지, 화면비, 합격 기준을 후보 두세 개에 통과시키고 실제로 납품할 것에 비추어 결과물을 판단하십시오.

리더보드 주장은 얼마나 오래 유효한가요?

정해진 답은 없지만 이 글의 사례는 사흘 만에 뒤집혔습니다. 날짜 없는 순위 주장은 과거 정보로 취급하고, 그것에 의존하는 결정을 내리기 전에 다시 확인하세요.

OmniArt에서 시작하기

실용적인 수는 발표문 비교를 그만두고 결과물을 비교하는 것입니다. OmniArt 이미지 워크스페이스를 열고, 실제로 납품해야 하는 일감 하나를 골라, 동일한 입력과 미리 써 둔 합격 기준으로 두 모델에 통과시켜 보세요.

OmniArt는 이미지·영상·오디오·음악 모델을 한 워크스페이스에 모아 두므로, 후보 목록이 네 개의 사이트와 네 개의 결제 페이지를 오가는 조사 과제가 아니라 그 자리에서의 나란한 테스트가 됩니다. 다음 달에 리더보드가 다시 뒤바뀔 때 — 반드시 그렇게 됩니다 — 어떤 모델이 내 일을 해내는지는 이미 알고 있을 것입니다. 돈이 되는 순위는 그것뿐입니다.

제작할 준비가 되셨나요?

AI로 멋진 콘텐츠를 생성하세요

무료로 시작하기