Prompts de MAI-Image-2.6: cuatro lecciones de Microsoft
MAI-Image-2.6 de Microsoft ha llegado al segundo puesto de la Arena. La parte más reutilizable del lanzamiento son los prompts publicados junto a él: cuatro formas de escribir y cuatro reglas que sirven en cualquier modelo.

El 10 de agosto de 2026, Microsoft AI anunció MAI-Image-2.6 y afirmó que ocupaba el segundo puesto en la clasificación de texto a imagen de la Arena, con +79 Elo respecto a MAI-Image-2.5 en conjunto y +91 Elo solo en la representación de texto. Ese es el titular y, como casi todos los titulares de clasificación, caduca rápido.
La parte del lanzamiento con más recorrido es más discreta: en las páginas de MAI-Image-2, MAI-Image-2.5 y MAI-Image-2.6, Microsoft publicó los prompts reales que hay detrás de sus imágenes de ejemplo. No son un surtido al azar. Son cuatro maneras claramente distintas de escribir para un modelo de imagen, y cada una hace un trabajo concreto: describir, comprimir, editar y citar.
MAI-Image no está en el selector de modelos de OmniArt, así que esto no es el análisis de un modelo que puedas ejecutar aquí. Es una lectura del oficio de escribir prompts que queda a la vista, porque ese oficio se traslada. Los cuatro patrones de abajo funcionan en cualquier modelo de imagen actual solvente, y la lección tiene siempre la misma forma: lo que pones en el prompt determina qué fallo obtendrás.
Qué trajo cada versión: MAI-Image 2, 2.5 y 2.6
Tres lanzamientos en menos de cinco meses, cada uno con un centro de gravedad distinto:
| Versión | Anuncio | Posicionamiento de Microsoft | Afirmación sobre la Arena |
|---|---|---|---|
| MAI-Image-2 | 19 de marzo de 2026 | Fotorrealismo, texto dentro de la imagen, escenas ricas: «creado con creativos» | 3.ª familia de modelos |
| MAI-Image-2.5 | Página del modelo | Edición precisa, fidelidad de materiales, resultado listo para diseño; Pro / estándar / Flash | 3.ª en texto a imagen, a 2 de junio de 2026 |
| MAI-Image-2.6 | 10 de agosto de 2026 | Representación de texto, retratos y 3D, acabado comercial y cinematográfico | 2.ª en texto a imagen; +79 Elo respecto a 2.5 |
MAI-Image-2.5 también se dividió en una familia: 2.5-Pro para coherencia de objetos y razonamiento visual, 2.5 para generación con edición controlable y 2.5-Flash, que Microsoft describe como listo para producción a menos de la mitad del precio del modelo insignia. La página de 2.5 incluye un gráfico de «Image Arena Elo frente al precio de API representativo por 1.000 imágenes», que revela qué optimiza el equipo: no solo la calidad máxima, sino la calidad por euro.
Sobre 2.6, Microsoft dice que queda material sin detallar: «desde trabajar con varias referencias y un anclaje más rico hasta un mayor control sobre el razonamiento, el formato y la resolución». Mientras eso no salga públicamente, es una declaración de hoja de ruta, no una especificación.
Lección 1: el prompt largo y estructurado pone cada dato en su casilla
El prompt que hay detrás del ejemplo de fotorrealismo de la página de MAI-Image-2.5 ronda las 90 palabras, y su estructura resulta más interesante que su extensión:
A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.
Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

Vuelve a leerlo como un formulario y no como un texto. La primera frase es sujeto, pose, acción y cielo. La segunda, pelo y ropa. La tercera, atrezo, uno por mano. La cuarta, un elemento contable. Después, un bloque etiquetado —Behind her:— se lleva todo lo ambiental, y una indicación de estilo de dos palabras cierra el prompt.
Tres cosas de esa estructura hacen trabajo real:
- Nombres de color en lugar de adjetivos. «Hot pink», «neon lime-green», «dark navy», «gold», «flat gray». Ni «brillante» ni «colorido». Un nombre de color es una restricción que el modelo puede cumplir o fallar de forma visible; «vibrant» no lo es.
- Una cifra en lugar de una cantidad vaga. «Five iridescent bubbles of varying sizes» se puede comprobar; «some bubbles», no. En el resultado publicado la cuenta se mantiene: puedes ponerte delante de la imagen y contarlas, que es justo el objetivo.
- El fondo tiene su propio recipiente.
Behind her:acota el entorno para que sus detalles no se filtren en la descripción del sujeto. Los prompts largos fallan donde el modelo tiene que adivinar a qué sustantivo pertenece un modificador.
La palabra de estilo va al final, después del contenido, de modo que modifica una escena ya especificada por completo en vez de dirigir la composición.
Consejo
Escribe los prompts largos como casillas y no como prosa: sujeto y acción, luego aspecto, luego atrezo, luego detalle contable, luego un bloque de entorno etiquetado y luego estilo. Si tú no puedes señalar a qué casilla pertenece una palabra, el modelo tampoco.
Lección 2: el prompt corto compra la composición con una comparación
El anuncio de MAI-Image-2 publicó un prompt muy distinto: unas 30 palabras, sin frases, solo sintagmas ordenados por importancia.
A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

El primer sintagma contiene todo el truco. «Like a cathedral interior» no es adorno: es una instrucción de composición disfrazada de metáfora. Una catedral trae consigo un techo abovedado, una nave que se aleja, un arco, simetría y luz entrando por el fondo. El resultado tiene las cinco, ejecutadas en hielo. Describir esa disposición de forma literal habría costado treinta palabras y probablemente habría salido más rígido.
El segundo movimiento útil es tiny human figure at base for scale. La escala es lo que los modelos de imagen pierden con más facilidad, porque ninguna textura indica su tamaño. Una referencia humana nombrada, en una posición nombrada, la fija en cuatro palabras, y la chaqueta roja del resultado hace más por la composición que cualquier acumulación de «epic, massive, enormous».
Los términos finales —cinematic, cold mist in air, hyper-real detail— son atmósfera e indicaciones de renderizado, y van al final por la misma razón que la palabra de estilo de la lección 1.
Así que estos dos prompts no son la versión buena y la mala de lo mismo. Son herramientas distintas:
| Usa el prompt largo estructurado cuando | Usa el prompt corto apilado cuando |
|---|---|
| importan ropa, atrezo o detalles de marca concretos | quieres una imagen potente y luego iterar |
| alguien va a contrastar el resultado con un briefing | el ambiente pesa más que el inventario |
| tendrás que reproducirlo más adelante | estás explorando una estética |
| las cifras y los colores no se negocian | una buena comparación puede sostener la composición |
Lección 3: al editar, un prompt debería cambiar una cosa
La página de MAI-Image-2.5 demuestra la edición con tres prompts, y lo llamativo es lo pequeño que es cada uno:
Change the tote color to orange
Add peonies peeking out the tote
Edit this image to have the woman walking through the streets of New York City
Este es el primero, antes y después:


El prompt tiene seis palabras: un verbo, un objeto nombrado y un valor de destino. No pide de paso otro fondo, otro ángulo ni mejor iluminación. Esa contención es la técnica, porque en una edición el trabajo más difícil del modelo es conservar, no cambiar. Todo lo que añades a la instrucción es una cosa más que podría decidir rehacer.
Fíjate también en que el objeto está nombrado. «The tote» le da al modelo un referente inequívoco. «Ponlo naranja» deja que el modelo elija entre la bolsa, la mesa y la pared.
El tercer prompt —trasladar al sujeto a Nueva York— parece una operación mucho mayor, y lo es. Pero sigue siendo una operación, y sigue nombrando lo que debe permanecer: «the woman». Un prompt que además reestilizara la ropa y cambiara la hora del día no te dejaría manera de saber qué instrucción provocó un mal resultado.
Advertencia
Una cadena de ediciones pequeñas es también una cadena de desviaciones pequeñas. Revisa los detalles que te importan después de cada paso y no solo al final: los tonos de piel, la geometría de un logotipo y el texto son lo primero que se degrada en silencio a lo largo de varias pasadas.
Lección 4: una referencia cultural es barata, y solo compra la escena
El prompt publicado más corto tiene ocho palabras:
Chihuahua in Abbey Road album cover with moptop wig


Ocho palabras reconstruyen una escena muy concreta: el paso de cebra, la avenida arbolada que se aleja, el VW Escarabajo blanco aparcado a la izquierda, coches de época, peatones con abrigos sesenteros y el encuadre frontal y plano. Escribirlo entero costaría un párrafo y probablemente se dejaría el Escarabajo. Microsoft archiva esto bajo «conocimiento del mundo y razonamiento», y el marco es correcto: una referencia muy conocida es el prompt más comprimido disponible.
También es el menos controlable, y este ejemplo muestra exactamente dónde está el límite. Compara las dos imágenes: la de partida es un chihuahua crema, de pelo corto y orejas erguidas, sobre negro. El resultado es un perro blanco y marrón, con otro pelaje, otras proporciones y otras orejas. La referencia compró la escena. No conservó al sujeto.
Esa distinción es la lección práctica. La taquigrafía por referencia es excelente para levantar un mundo: un género, una época, una convención de luz, una maquetación. No es fiable para la identidad. Si una cara, una mascota, un producto o un empaquetado concretos tienen que sobrevivir, ese requisito pertenece a una descripción explícita o a un flujo con imagen de referencia, no a una alusión cultural.
Conviene tener presentes dos salvedades más: una referencia solo funciona si el modelo la conoce, de modo que las referencias oscuras o regionales degeneran en silencio hacia un resultado genérico; y las imágenes célebres arrastran cuestiones de derechos que un prompt no resuelve por ti.
Por qué la representación de texto se convirtió en la cifra del titular
De todo lo que hay en el anuncio de 2.6, la cifra que Microsoft eligió desglosar por separado fue la del texto: +91 Elo, por encima de la mejora global de +79 Elo. Es un énfasis deliberado, y los ejemplos explican por qué.

Escribir bien un titular es la mitad fácil. El cartel de arriba mantiene además un topónimo francés con acentos, un asterisco dentro de una categoría, una lista de fechas separadas por comas y, sobre todo, una jerarquía: línea de fechas subordinada, titular dominante, ilustración con los dos tercios superiores. Un modelo que escribe a la perfección pero da el mismo peso visual a todos los bloques de texto sigue produciendo una maquetación inservible.
Esta es la parte de la generación de imágenes más cercana al trabajo remunerado, y por eso las citas de socios de la página de 2.5 giran a su alrededor. Rob Reilly, global chief creative officer de WPP, señala la precisión del texto como «un avance real», junto con la edición en lenguaje natural; Vanessa Salvo, de Shutterstock, plantea la métrica relevante como la capacidad de los modelos de «traducir la intención en resultados coherentes y listos para producción». Empaquetados, carteles, cartas de restaurante y piezas de campaña fallan por la tipografía antes que por el fotorrealismo.
Qué dice y qué no dice el «segundo puesto en la Arena»
Los resultados de la Arena son comparaciones ciegas de preferencia humana, así que un salto grande de Elo es una señal real de que la gente prefirió esos resultados en un conjunto mixto de prompts. Es un resultado auténtico, y +79 Elo en unos dos meses supone una subida rápida.
También es una única cifra agregada. El anuncio de Microsoft no publica valores de Elo por categoría, ni intervalos de confianza, ni el tamaño del conjunto de prompts, ni la identidad del modelo que está por encima. A 14 de agosto de 2026 siguen sin publicarse varios datos que un equipo necesitaría antes de comprometer una cadena de producción:
- El precio de API por imagen del nivel 2.6
- Las resoluciones de salida nativa y máxima
- Las cifras de latencia de generación y edición
- Las capacidades de múltiples referencias y anclaje descritas como «próximamente»
- Un informe técnico detrás de las diferencias de Elo
Nota
Un puesto global en la Arena no puede decirte si un modelo sirve para tu trabajo concreto. Un empaquetado con mucho texto en un alfabeto no latino, una cara que debe repetirse en doce tomas y un recurso transparente para la interfaz de un videojuego son tres pruebas distintas, y un modelo puede liderar el agregado y perder cualquiera de ellas.
La lectura honesta de 2.6 es estrecha y aun así útil: Microsoft itera esta familia deprisa y dirige las mejoras al resultado comercial —texto, retratos, producto, marca— y no al espectáculo.
Cómo aplicar estos cuatro patrones en OmniArt
MAI-Image no está disponible ahora mismo en el espacio de imagen de OmniArt. Los patrones de prompt sí, y no dependen del modelo. Elige según cuál de los cuatro trabajos es realmente tu encargo:
| El patrón | Para qué sirve | Un punto de partida práctico en OmniArt |
|---|---|---|
| Prompt largo estructurado | Encargos donde se comprueban ropa, atrezo, colores y cifras | GPT Image 2 |
| Prompt corto apilado con comparación | Imágenes únicas cinematográficas y exploración de ambiente | Seedream 5.0 Pro |
| Edición de un cambio por pasada | Variantes de color de producto, añadidos, traslado controlado | Nano Banana 2 |
| Taquigrafía por referencia más identidad explícita | Construcción de mundo donde un sujeto debe mantenerse | Seedream 5.0 Pro con imágenes de referencia |
| Iteración barata antes de comprometerse | Probar estructuras de prompt a bajo coste | Qwen Image |
Un ejercicio útil: coge el prompt de la azotea de arriba, ejecútalo tal cual y vuelve a ejecutarlo sustituyendo los colores por adjetivos («a pink bottle», «a green wand») y la cifra por «some bubbles». La distancia entre ambos resultados es el valor de la estructura, medido en tu modelo y no en una galería de lanzamiento.
Para un cara a cara reciente sobre maquetación y fotorrealismo, consulta GPT Image 2 frente a Nano Banana 2. Sobre coherencia guiada por referencias, la guía de lanzamiento de Seedream 5.0 Pro cubre sus entradas y controles, y la guía de Qwen Image es la vía económica para los primeros bocetos. Como análisis de lanzamiento comparable, Grok Imagine Image 2.0 hizo una afirmación parecida sobre la Arena esa misma semana.
Preguntas frecuentes
¿Qué es MAI-Image-2.6?
MAI-Image-2.6 es el modelo de texto a imagen de Microsoft AI anunciado el 10 de agosto de 2026. Microsoft afirma que ocupa el segundo puesto en la clasificación de texto a imagen de la Arena, con +79 Elo respecto a MAI-Image-2.5 y +91 Elo en representación de texto.
¿En qué se diferencia MAI-Image-2.6 de MAI-Image-2.5?
Microsoft describe mejoras en todas las categorías medidas de la Arena, con énfasis específico en la representación de texto, los retratos y el 3D, y en un resultado comercial y fotorrealista más pulido en trabajo de producto, marca y cinematográfico. La entrada con múltiples referencias, un anclaje más rico y un mayor control sobre razonamiento, formato y resolución se describen como próximos, sin detalles publicados.
¿Dónde puedo usar MAI-Image-2.6?
Según el anuncio de Microsoft, está disponible para texto a imagen en la Arena, llega a MAI Playground esa misma semana y después se despliega en Microsoft Foundry y otros productos.
¿Está MAI-Image en OmniArt?
No. MAI-Image no figura en el selector de modelos de imagen de OmniArt. Los patrones de prompt de este artículo no dependen del modelo y se pueden usar con los modelos de imagen que sí ofrece OmniArt.
¿Qué incluye la familia MAI-Image-2.5?
Tres variantes: MAI-Image-2.5-Pro para coherencia de objetos y razonamiento visual, MAI-Image-2.5 para generación de calidad con edición controlable y MAI-Image-2.5-Flash, descrito como listo para producción a menos de la mitad del precio del modelo insignia.
¿Funcionan estos patrones de prompt en otros modelos?
Sí. Los nombres de color, las cifras explícitas, un bloque de fondo acotado, una referencia de escala, un cambio por edición y una comparación compositiva son técnicas generales. Lo que cambia entre modelos es con cuánta fiabilidad se respeta cada una, y eso conviene probarlo en el modelo que uses de verdad.
Empezar en OmniArt
Abre el espacio de imagen de OmniArt y pasa un mismo encargo por dos de los cuatro patrones de arriba: una versión larga estructurada y una corta apilada de la misma idea. Mantén el sujeto idéntico y cambia solo la forma del prompt. Esa única comparación te dirá más sobre tu modelo que cualquier posición en una clasificación.
A partir de ahí, trata la edición como un trabajo aparte: aprueba una imagen y después haz un cambio por prompt, comprobando los detalles que te importan tras cada pasada. OmniArt reúne modelos de imagen, vídeo, audio y música en un mismo espacio, así que una imagen fija aprobada puede pasar directamente al movimiento sin cambiar de herramienta, y cuando un modelo nuevo se gane su sitio en el selector, los prompts que ya has aprendido a escribir se vienen contigo.
¿Listo para crear?
Empieza a generar contenido increíble con IA