MAI-Image-2.6 프롬프트: 마이크로소프트가 남긴 4가지 교훈
마이크로소프트의 MAI-Image-2.6이 Arena 2위에 올랐습니다. 이번 발표에서 더 오래 쓸 수 있는 것은 함께 공개된 프롬프트입니다. 네 가지 작성법과, 어떤 모델에도 옮길 수 있는 네 가지 규칙을 정리했습니다.

2026년 8월 10일, 마이크로소프트 AI는 MAI-Image-2.6을 발표하면서 Arena 텍스트-이미지 변환 리더보드 2위에 올랐다고 밝혔습니다. MAI-Image-2.5 대비 전체 +79 Elo, 텍스트 렌더링만 놓고 보면 +91 Elo 상승입니다. 이것이 헤드라인이고, 리더보드 헤드라인은 대체로 금방 낡습니다.
이번 발표에서 유효 기간이 훨씬 긴 부분은 더 조용합니다. MAI-Image-2, MAI-Image-2.5, MAI-Image-2.6 페이지에 걸쳐 마이크로소프트는 샘플 이미지 뒤에 있는 실제 프롬프트를 함께 공개했습니다. 이 프롬프트들은 아무렇게나 모아 놓은 묶음이 아닙니다. 이미지 모델에게 글을 쓰는 네 가지 뚜렷이 다른 방식이고, 각각 묘사·압축·편집·인용이라는 구체적인 일을 하고 있습니다.
MAI-Image는 OmniArt의 모델 목록에 없으므로, 이 글은 여기서 돌려 볼 수 있는 모델의 리뷰가 아닙니다. 여기서 읽는 것은 그 프롬프트에 드러난 작성 기술이고, 기술은 옮겨집니다. 아래 네 가지 패턴은 현행의 괜찮은 이미지 모델이라면 어디서든 동작하며, 결론의 모양은 모두 같습니다. 프롬프트에 무엇을 넣느냐가 어떤 실패를 얻을지 결정합니다.
MAI-Image 2, 2.5, 2.6은 각각 무엇을 내놓았나
다섯 달이 채 안 되는 사이 세 번의 릴리스, 그때마다 무게중심이 달랐습니다.
| 릴리스 | 발표일 | 마이크로소프트의 포지셔닝 | Arena 관련 주장 |
|---|---|---|---|
| MAI-Image-2 | 2026년 3월 19일 | 사실감, 이미지 속 텍스트, 풍부한 장면 생성 — '창작자와 함께' | 모델 패밀리 3위 |
| MAI-Image-2.5 | 모델 페이지 | 정밀 편집, 재질 정확도, 디자인 지향 결과물. Pro / 표준 / Flash | 텍스트-이미지 변환 3위, 2026년 6월 2일 기준 |
| MAI-Image-2.6 | 2026년 8월 10일 | 텍스트 렌더링, 인물과 3D, 상업·시네마틱 완성도 | 텍스트-이미지 변환 2위, 2.5 대비 +79 Elo |
MAI-Image-2.5는 하나의 패밀리로도 나뉘었습니다. 2.5-Pro는 오브젝트 일관성과 시각적 추론, 2.5는 생성과 제어 가능한 편집, 2.5-Flash는 마이크로소프트 설명에 따르면 플래그십 절반 이하 가격으로 실서비스에 쓸 수 있는 구성입니다. 2.5 모델 페이지에는 '이미지 Arena Elo 대 1,000장당 대표 API 가격' 차트가 있는데, 팀이 무엇을 최적화하는지 알려 줍니다. 화질의 정점만이 아니라 비용당 화질입니다.
2.6에 대해서는 아직 공개되지 않은 부분이 있다고 말합니다. '여러 참조 이미지를 넘나드는 작업과 더 풍부한 그라운딩부터, 추론·포맷·해상도에 대한 더 강한 제어까지.' 공개되기 전까지 이것은 사양이 아니라 로드맵 발언입니다.
교훈 1: 긴 구조화 프롬프트는 사실을 하나씩 칸에 넣습니다
MAI-Image-2.5 페이지의 사실감 샘플 뒤에 있는 프롬프트는 약 90단어이고, 길이보다 구조가 더 흥미롭습니다.
A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.
Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

문장이 아니라 하나의 서식으로 보고 다시 읽어 보세요. 첫 문장은 피사체·자세·동작·하늘입니다. 둘째 문장은 머리와 의상. 셋째 문장은 소품이고, 손마다 하나씩입니다. 넷째 문장은 셀 수 있는 요소입니다. 이어서 이름표가 붙은 블록 Behind her: 가 환경 정보를 모두 가져가고, 두 단어짜리 스타일 지시가 프롬프트를 닫습니다.
이 구조에서 실제로 일하는 것은 세 가지입니다.
- 형용사 대신 색 이름. 'hot pink', 'neon lime-green', 'dark navy', 'gold', 'flat gray'. '밝은'도 '화려한'도 아닙니다. 색 이름은 모델이 충족할 수도, 눈에 띄게 실패할 수도 있는 제약입니다. 'vibrant'는 그렇지 않습니다.
- 수량 표현 대신 숫자. 'Five iridescent bubbles of varying sizes'는 대조가 가능하지만 'some bubbles'는 불가능합니다. 공개된 결과물에서 이 개수는 실제로 지켜졌습니다. 이미지 앞에 서서 하나씩 셀 수 있다는 것, 그게 요점입니다.
- 배경은 자기 그릇에 담깁니다.
Behind her:가 환경을 울타리 안에 넣어 두므로 그 세부가 피사체 묘사로 새어 나가지 않습니다. 긴 프롬프트가 무너지는 지점은 어떤 수식어가 어느 명사에 붙는지를 모델이 추측해야 할 때입니다.
스타일 키워드는 맨 뒤에 놓여, 이미 완전히 지정된 장면에 적용됩니다. 구도 자체를 끌고 가는 것이 아닙니다.
팁
긴 프롬프트는 산문이 아니라 칸의 배열로 쓰세요. 피사체와 동작, 외형, 소품, 셀 수 있는 세부, 이름표가 붙은 환경 블록, 그리고 스타일. 어떤 단어가 어느 칸에 속하는지 스스로 짚지 못한다면 모델도 짚지 못합니다.
교훈 2: 짧은 프롬프트는 비유로 구도를 사들입니다
MAI-Image-2 발표에는 결이 완전히 다른 프롬프트가 실렸습니다. 약 30단어, 문장 형태가 없고 중요도 순으로 늘어선 구들뿐입니다.
A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

첫 번째 구가 요령의 전부입니다. 'like a cathedral interior'는 장식이 아니라 비유의 옷을 입은 구도 지시입니다. 성당은 볼트 천장, 안쪽으로 물러나는 신랑, 아치, 대칭, 그리고 끝에서 들어오는 빛을 함께 데려옵니다. 결과물에는 이 다섯 가지가 모두, 얼음으로 구현되어 있습니다. 같은 레이아웃을 그대로 서술하면 서른 단어가 들고 아마 더 뻣뻣해졌을 것입니다.
두 번째로 유용한 수는 tiny human figure at base for scale 입니다. 스케일은 이미지 모델이 가장 잘 놓치는 요소입니다. 질감 자체는 그것이 얼마나 큰지 알려 주지 않기 때문입니다. 위치가 명시된 사람 기준이 네 단어로 그것을 고정하고, 결과물 속 빨간 재킷은 'epic, massive, enormous'를 아무리 쌓는 것보다 더 많은 구도 작업을 하고 있습니다.
끝에 붙은 단어들 — cinematic, cold mist in air, hyper-real detail — 은 분위기와 렌더링 지시이고, 맨 뒤에 오는 이유는 교훈 1의 스타일 키워드와 같습니다.
그러니 두 프롬프트는 같은 것의 좋은 판본과 나쁜 판본이 아닙니다. 서로 다른 도구입니다.
| 긴 구조화 프롬프트가 맞는 경우 | 짧은 적층 프롬프트가 맞는 경우 |
|---|---|
| 의상·소품·브랜드 세부가 중요한 작업 | 강한 한 장을 얻고 이어서 반복할 때 |
| 누군가 결과물을 요구사항과 대조할 때 | 목록보다 분위기가 중요할 때 |
| 나중에 재현해야 할 때 | 룩을 탐색하는 중일 때 |
| 개수와 색에 타협의 여지가 없을 때 | 좋은 비유가 구도를 감당할 수 있을 때 |
교훈 3: 편집에서는 프롬프트 하나가 한 가지만 바꿉니다
MAI-Image-2.5 페이지는 프롬프트 세 개로 편집을 보여 주는데, 눈에 띄는 것은 모두 작다는 점입니다.
Change the tote color to orange
Add peonies peeking out the tote
Edit this image to have the woman walking through the streets of New York City
첫 번째의 편집 전과 편집 후입니다.


프롬프트는 여섯 단어입니다. 동사 하나, 이름이 붙은 대상 하나, 목표값 하나. 배경을 바꾸라거나 각도를 틀라거나 조명을 개선하라고 곁들이지 않습니다. 이 절제가 곧 기술입니다. 편집에서 모델의 가장 어려운 일은 바꾸는 것이 아니라 지키는 것이기 때문입니다. 지시에 무언가를 더할 때마다 모델이 다시 만들어 버릴 대상이 하나씩 늘어납니다.
대상에 이름이 붙었다는 점도 눈여겨보세요. 'the tote'는 모델에게 모호하지 않은 지시 대상을 줍니다. '주황색으로 만들어'라고 하면 모델이 가방과 테이블과 벽 중에서 직접 고르게 됩니다.
세 번째 프롬프트, 즉 인물을 뉴욕으로 옮기는 것은 훨씬 큰 작업으로 보이고 실제로도 그렇습니다. 그래도 여전히 한 번의 작업이고, 유지해야 할 것을 이름으로 지목합니다. 'the woman'입니다. 도시도 바꾸고 의상도 손보고 시간대까지 바꾸는 프롬프트라면, 어떤 지시가 나쁜 결과를 만들었는지 판단할 방법이 없습니다.
경고
작은 편집의 연쇄는 작은 어긋남의 연쇄이기도 합니다. 신경 쓰는 세부는 마지막에 몰아서가 아니라 매 단계 뒤에 확인하세요. 피부 톤, 로고의 기하 형태, 텍스트는 여러 차례를 거치면 가장 먼저 조용히 나빠집니다.
교훈 4: 문화적 인용은 싸지만, 사 오는 것은 장면뿐입니다
공개된 프롬프트 중 가장 짧은 것은 여덟 단어입니다.
Chihuahua in Abbey Road album cover with moptop wig


여덟 단어가 매우 구체적인 장면을 재구성합니다. 횡단보도, 멀어지는 가로수길, 왼쪽에 세워진 흰색 비틀, 당시의 자동차, 60년대 코트를 입은 행인, 그리고 정면의 평평한 프레이밍. 이를 풀어 쓰면 한 문단이 들고 그래도 비틀은 놓칠 가능성이 큽니다. 마이크로소프트는 이것을 '세계 지식과 추론'으로 분류하는데 적절한 틀입니다. 널리 알려진 인용은 사용할 수 있는 가장 압축된 프롬프트입니다.
동시에 가장 통제하기 어렵기도 하고, 이 예시가 그 한계가 어디인지 정확히 보여 줍니다. 두 이미지를 비교해 보세요. 원본은 검은 배경 앞의 크림색 단모, 귀가 선 치와와입니다. 결과물은 흰색과 갈색이 섞인, 털결도 비율도 귀도 다른 개입니다. 인용은 장면을 사 왔지만 피사체는 지키지 못했습니다.
이 구분이 실무적인 결론입니다. 인용식 축약은 하나의 세계를 세우는 데 훌륭합니다. 장르, 시대, 조명 관습, 레이아웃 같은 것들 말입니다. 동일성 유지에는 믿을 수 없습니다. 특정한 얼굴, 반려동물, 제품, 포장이 반드시 살아남아야 한다면 그 요구는 명시적인 묘사나 참조 이미지 작업에 들어가야지, 문화적 암시에 맡길 일이 아닙니다.
기억해 둘 두 가지가 더 있습니다. 인용은 모델이 그것을 알고 있을 때만 작동하므로, 알려지지 않았거나 지역적인 인용은 조용히 평범한 결과로 무너집니다. 그리고 널리 알려진 이미지에는 권리 문제가 따라붙는데, 프롬프트가 그것을 대신 해결해 주지는 않습니다.
텍스트 렌더링이 헤드라인 숫자가 된 이유
2.6 발표 내용 가운데 마이크로소프트가 따로 떼어 낸 숫자는 텍스트였습니다. +91 Elo, 전체 상승폭 +79 Elo보다 높습니다. 의도적인 강조이고, 샘플 작업이 그 이유를 설명합니다.

헤드라인의 철자를 맞히는 것은 쉬운 쪽 절반입니다. 위 포스터는 악센트가 붙은 프랑스어 지명, 등급 표기의 별표, 쉼표로 나뉜 날짜, 그리고 무엇보다 위계까지 지켜 냅니다. 날짜 줄은 종속되고 헤드라인이 주도하며 일러스트가 위쪽 3분의 2를 차지합니다. 철자는 완벽한데 모든 텍스트 블록에 같은 시각적 무게를 주는 모델은 여전히 쓸 수 없는 지면을 내놓습니다.
이 지점이 이미지 생성에서 유료 작업에 가장 가까운 영역이고, 2.5 페이지의 파트너 인용이 여기에 몰린 이유이기도 합니다. WPP의 글로벌 최고 크리에이티브 책임자 Rob Reilly는 자연어 편집과 나란히 텍스트 정확도를 '진짜 돌파구'로 꼽습니다. Shutterstock의 Vanessa Salvo는 관련 지표를 모델이 의도를 '일관되고 실서비스에 쓸 수 있는 결과물로 옮기는지'로 정의합니다. 포장, 포스터, 메뉴, 캠페인 소재는 사실감보다 먼저 타이포그래피에서 무너집니다.
'Arena 2위'가 알려 주는 것과 알려 주지 않는 것
Arena 결과는 블라인드로 진행되는 사람의 선호 비교이므로, 큰 폭의 Elo 상승은 섞인 프롬프트 집합에서 사람들이 그 결과물을 더 선호했다는 실제 신호입니다. 진짜 성과이고, 두 달 남짓에 +79 Elo는 빠른 상승입니다.
동시에 그것은 하나의 집계값이기도 합니다. 마이크로소프트의 발표는 카테고리별 Elo도, 신뢰 구간도, 프롬프트 집합의 규모도, 위에 있는 모델이 무엇인지도 공개하지 않았습니다. 2026년 8월 14일 기준으로, 파이프라인을 확정하기 전에 필요한 몇 가지는 여전히 공개되지 않았습니다.
- 2.6 등급의 이미지당 API 가격
- 네이티브 및 최대 출력 해상도
- 생성과 편집의 지연 시간 수치
- '곧 제공'이라고 설명된 다중 참조 및 그라운딩 기능
- Elo 차이를 뒷받침하는 기술 보고서
참고
종합 Arena 순위는 그 모델이 내 작업에 맞는지 알려 주지 못합니다. 비라틴 문자로 된 텍스트 중심 포장, 열두 컷에서 똑같이 유지되어야 하는 얼굴, 게임 UI용 투명 소재는 서로 다른 세 가지 시험이고, 종합에서 앞서면서도 그중 어느 하나에서는 질 수 있습니다.
2.6에 대한 정직한 독법은 좁지만 그래도 유용합니다. 마이크로소프트는 이 패밀리를 빠르게 굴리고 있고, 그 상승분을 볼거리가 아니라 상업적 결과물 — 텍스트, 인물, 제품, 브랜드 — 에 겨누고 있습니다.
OmniArt에서 이 네 가지 패턴 써 보기
MAI-Image는 현재 OmniArt의 이미지 워크스페이스에 없습니다. 프롬프트 패턴은 있고, 모델을 가리지 않습니다. 내 작업이 네 가지 일 중 무엇인지로 골라 보세요.
| 패턴 | 쓰임새 | OmniArt에서의 출발점 |
|---|---|---|
| 긴 구조화 프롬프트 | 의상·소품·색·개수를 대조하게 되는 작업 | GPT Image 2 |
| 비유를 쓴 짧은 적층 프롬프트 | 시네마틱한 단일 이미지와 분위기 탐색 | Seedream 5.0 Pro |
| 한 번에 하나만 바꾸는 편집 | 제품 컬러웨이, 요소 추가, 통제된 장소 이동 | Nano Banana 2 |
| 인용식 축약 + 명시적 동일성 묘사 | 피사체를 유지해야 하는 장면 구축 | Seedream 5.0 Pro와 참조 이미지 |
| 확정 전 저비용 반복 | 프롬프트 구조를 싸게 시험하기 | Qwen Image |
유용한 연습이 하나 있습니다. 위 옥상 프롬프트를 그대로 한 번 돌리고, 색을 형용사로 바꾸고('a pink bottle', 'a green wand') 개수를 'some bubbles'로 바꿔 한 번 더 돌려 보세요. 두 결과물의 격차가 구조의 가치이고, 발표 페이지의 갤러리가 아니라 내 모델에서 잰 값입니다.
레이아웃과 사실감의 최신 맞대결은 GPT Image 2와 Nano Banana 2 비교를, 참조 이미지 기반 일관성은 Seedream 5.0 Pro 출시 가이드를 보세요. Qwen Image 가이드는 초기 시안을 위한 저비용 경로입니다. 비슷한 최근 출시 분석으로는, 같은 주에 유사한 Arena 주장을 내놓은 Grok Imagine Image 2.0이 있습니다.
자주 묻는 질문
MAI-Image-2.6은 무엇인가요?
MAI-Image-2.6은 마이크로소프트 AI가 2026년 8월 10일에 발표한 텍스트-이미지 변환 모델입니다. 마이크로소프트는 Arena 텍스트-이미지 변환 리더보드 2위에 올랐고 MAI-Image-2.5 대비 전체 +79 Elo, 텍스트 렌더링 +91 Elo가 향상되었다고 밝혔습니다.
MAI-Image-2.6은 MAI-Image-2.5와 어떻게 다른가요?
마이크로소프트는 측정된 모든 Arena 카테고리에서 향상되었다고 하면서, 특히 텍스트 렌더링, 인물과 3D, 그리고 제품·브랜딩·시네마틱 작업 전반의 상업적·사실적 결과물 완성도를 강조합니다. 다중 참조 입력, 더 풍부한 그라운딩, 추론·포맷·해상도에 대한 제어는 '곧 제공'으로 설명되었고 세부는 공개되지 않았습니다.
MAI-Image-2.6은 어디에서 쓸 수 있나요?
마이크로소프트 발표에 따르면 Arena에서 텍스트-이미지 변환으로 사용할 수 있고, 같은 주 후반에 MAI Playground에 들어가며, 이후 Microsoft Foundry와 다른 제품으로 순차 적용됩니다.
OmniArt에서 MAI-Image를 쓸 수 있나요?
없습니다. OmniArt의 이미지 모델 목록에 MAI-Image는 없습니다. 이 글의 프롬프트 패턴은 모델을 가리지 않으므로 OmniArt가 제공하는 이미지 모델에서 사용할 수 있습니다.
MAI-Image-2.5 패밀리는 어떻게 구성되나요?
세 가지입니다. 오브젝트 일관성과 시각적 추론을 위한 MAI-Image-2.5-Pro, 고품질 생성과 제어 가능한 편집을 위한 MAI-Image-2.5, 그리고 플래그십 절반 이하 가격으로 실서비스에 쓸 수 있다고 설명된 MAI-Image-2.5-Flash입니다.
이 프롬프트 패턴이 다른 모델에서도 통하나요?
통합니다. 색 이름, 명시적인 개수, 따로 울타리를 친 배경 블록, 스케일 기준, 한 번에 하나만 바꾸는 편집, 구도를 감당하는 비유는 모두 일반적인 프롬프트 기법입니다. 모델마다 다른 것은 각 기법이 얼마나 안정적으로 지켜지는지이고, 실제로 쓰는 모델에서 시험해 볼 가치가 있습니다.
OmniArt에서 시작하기
OmniArt 이미지 워크스페이스를 열고, 하나의 과제를 위 네 패턴 중 두 가지로 각각 돌려 보세요. 같은 아이디어의 긴 구조화 버전과 짧은 적층 버전입니다. 피사체는 그대로 두고 프롬프트의 형식만 바꿉니다. 이 한 번의 비교가 어떤 리더보드 순위보다 내 모델에 대해 더 많은 것을 알려 줍니다.
거기서부터 편집은 별개의 작업으로 다루세요. 먼저 한 장을 확정하고, 프롬프트 하나로 한 가지만 바꾸고, 매 단계 뒤에 신경 쓰는 세부를 확인합니다. OmniArt는 이미지·영상·오디오·음악 모델을 한 워크스페이스에 모아 두므로 확정한 스틸을 도구를 바꾸지 않고 바로 움직임으로 가져갈 수 있습니다. 그리고 새 모델이 목록에 들어올 자격을 얻었을 때, 이미 익힌 프롬프트 작성법은 그대로 따라옵니다.
제작할 준비가 되셨나요?
AI로 멋진 콘텐츠를 생성하세요