Prompts de MAI-Image-2.6: cuatro lecciones de Microsoft AI
MAI-Image-2.6 de Microsoft llegó al puesto n.º 2 de Arena. La parte más reutilizable del lanzamiento son los prompts publicados junto al modelo: cuatro estilos distintos, cuatro reglas que puedes aplicar a cualquier modelo de imagen.

El 10 de agosto de 2026, Microsoft AI anunció MAI-Image-2.6 y dijo que quedó segundo en la tabla de texto a imagen de Arena, con una mejora de +79 Elo sobre MAI-Image-2.5 en general y de +91 Elo solo en renderizado de texto. Ese es el titular y, como casi todos los titulares de tablas de posiciones, vence rápido.
La parte del lanzamiento con vida más larga es más silenciosa: en las páginas de MAI-Image-2, MAI-Image-2.5 y MAI-Image-2.6, Microsoft publicó los prompts reales detrás de sus imágenes de muestra. Esos prompts no son un surtido al azar. Son cuatro formas claramente distintas de escribirle a un modelo de imagen, y cada una hace un trabajo específico: describir, comprimir, editar y referenciar.
MAI-Image no está en el selector de modelos de OmniArt, así que esto no es una reseña de un modelo que puedas correr acá. Es una lectura del oficio de escribir prompts que quedó a la vista, porque ese oficio se transfiere. Los cuatro patrones de abajo funcionan en cualquier modelo de imagen actual competente, y la lección de cada uno tiene la misma forma: lo que pones en el prompt determina qué falla te toca.
Qué lanzó Microsoft en MAI-Image 2, 2.5 y 2.6
Tres lanzamientos en menos de cinco meses, cada uno con un centro de gravedad distinto:
| Lanzamiento | Anuncio | Posicionamiento de Microsoft | Afirmación en Arena |
|---|---|---|---|
| MAI-Image-2 | 19 de marzo de 2026 | Fotorrealismo, texto dentro de la imagen, escenas ricas: “hecho con creativos” | N.º 3 entre las familias de modelos |
| MAI-Image-2.5 | Página del modelo | Edición precisa, fidelidad de materiales, salida consciente del diseño; variantes Pro / estándar / Flash | Tercero en texto a imagen, al 2 de junio de 2026 |
| MAI-Image-2.6 | 10 de agosto de 2026 | Renderizado de texto, retratos y 3D, acabado comercial y cinematográfico | Segundo en texto a imagen; +79 Elo sobre 2.5 |
MAI-Image-2.5 además se dividió en una familia: 2.5-Pro para consistencia de objetos y razonamiento visual, 2.5 para generación más edición controlable, y 2.5-Flash, que Microsoft describe como listo para producción a menos de la mitad del precio del modelo insignia. La página del modelo 2.5 grafica “Elo en Image Arena contra precio de API representativo por cada 1,000 imágenes”, lo que revela qué está optimizando el equipo: no solo la calidad máxima, sino la calidad por dólar.
Para 2.6, Microsoft dice que hay más que todavía no detalló: “trabajar con varias referencias y un anclaje más rico, hasta mayor control sobre razonamiento, formato y resolución”. Hasta que eso salga públicamente, es una declaración de hoja de ruta, no una especificación.
Lección 1: el prompt largo y estructurado le da a cada dato su propia casilla
El prompt detrás de la muestra de fotorrealismo de la página de MAI-Image-2.5 tiene unas 90 palabras, y su estructura es más interesante que su longitud:
A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.
Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

Vuelve a leerlo como una forma y no como una oración. La primera oración es sujeto, pose, acción y cielo. La segunda es cabello y vestuario. La tercera son los objetos, uno por mano. La cuarta es un elemento contable. Después un bloque etiquetado —Behind her:— se lleva todo lo ambiental, y una directiva de estilo de dos palabras cierra el prompt.
Tres cosas de esa estructura hacen trabajo real:
- Colores con nombre en vez de adjetivos. "Hot pink", "neon lime-green", "dark navy", "gold", "flat gray". No "bright", no "colourful". El nombre de un color es una restricción que el modelo puede cumplir o incumplir de forma visible; "vibrant" no lo es.
- Un número en vez de un cuantificador. "Five iridescent bubbles of varying sizes" se puede verificar. "Some bubbles" no. En el resultado publicado la cuenta se sostiene: puedes pararte frente a la imagen y auditarla, que es exactamente el punto.
- El fondo tiene su propio contenedor.
Behind her:cerca el entorno para que su detalle no se filtre a la descripción del sujeto. Los prompts largos fallan cuando el modelo tiene que adivinar a qué sustantivo pertenece cada modificador.
La palabra de estilo aterriza al final, después del contenido, así que modifica una escena que ya está completamente especificada en vez de dirigir la composición.
Consejo
Escribe los prompts largos como casillas, no como prosa: sujeto y acción, después apariencia, después objetos, después detalle contable, después un bloque de entorno etiquetado, y al final el estilo. Si no puedes señalar a qué casilla pertenece una palabra, el modelo tampoco puede.
Lección 2: el prompt corto compra composición con un símil
El anuncio de MAI-Image-2 publicó un prompt muy distinto: unas 30 palabras, sin oraciones, solo cláusulas ordenadas por jerarquía:
A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

La primera cláusula es todo el truco. "Like a cathedral interior" no es decoración: es una instrucción de composición disfrazada de metáfora. Una catedral trae techo abovedado, una nave que se aleja, un arco, simetría y luz que entra desde el fondo. El resultado tiene los cinco, renderizados en hielo. Describir esa distribución de forma literal habría llevado treinta palabras y probablemente habría salido más rígido.
El segundo movimiento útil es tiny human figure at base for scale. La escala es lo que los modelos de imagen pierden con más facilidad, porque nada en una textura te dice qué tan grande es. Una referencia humana con nombre en una posición con nombre la fija en cuatro palabras, y la chaqueta roja del resultado hace más trabajo compositivo que cualquier cantidad de "epic, massive, enormous".
Los términos finales —cinematic, cold mist in air, hyper-real detail— son atmósfera y directivas de render, y van al final por la misma razón que la palabra de estilo en la lección 1.
Así que los dos prompts no son versiones mejor y peor de lo mismo. Son herramientas distintas:
| Usa el prompt largo estructurado cuando | Usa el prompt corto apilado cuando |
|---|---|
| Importan vestuario, objetos o detalles de marca específicos | Quieres una imagen fuerte y vas a iterar |
| Alguien va a revisar el resultado contra un brief | El tono importa más que el inventario |
| Necesitas reproducirlo más adelante | Estás explorando un aspecto |
| Las cuentas y los colores no se negocian | Una buena analogía puede cargar la composición |
Lección 3: en edición, un prompt debería hacer un solo cambio
La página de MAI-Image-2.5 demuestra la edición con tres prompts, y lo que destaca es lo chico que es cada uno:
Change the tote color to orange
Add peonies peeking out the tote
Edit this image to have the woman walking through the streets of New York City
Este es el primero, antes y después:


El prompt tiene seis palabras: un verbo, un objeto nombrado, un valor objetivo. No pide además un fondo distinto, un ángulo nuevo ni mejor iluminación. Esa contención es la técnica, porque en una edición el trabajo más difícil del modelo es preservar, no cambiar. Todo lo que agregas a la instrucción es una cosa más que podría decidir rehacer.
Fíjate también en que el objeto está nombrado. "The tote" le da al modelo un referente inequívoco. "Make it orange" deja al modelo eligiendo entre la bolsa, la mesa y la pared.
El tercer prompt —mudar al sujeto a Nueva York— parece una operación mucho más grande, y lo es. Pero sigue siendo una operación, y sigue nombrando lo que debe persistir: "the woman". Un prompt de mudanza que además reestilizara su ropa y cambiara la hora del día no te dejaría forma de saber qué instrucción causó un mal resultado.
Advertencia
Una cadena de ediciones chicas también es una cadena de derivas chicas. Vuelve a revisar los detalles que te importan después de cada paso, no solo al final: el tono de piel, la geometría de un logo y el texto son lo primero que se degrada en silencio a lo largo de varias pasadas.
Lección 4: una referencia cultural es barata, y solo te compra la escena
El prompt publicado más corto tiene ocho palabras:
Chihuahua in Abbey Road album cover with moptop wig


Ocho palabras reconstruyen una escena muy específica: el paso de cebra, la calle arbolada que se aleja, el Volkswagen Escarabajo blanco estacionado a la izquierda, los autos de época, los peatones con abrigos sesenteros y el encuadre frontal plano. Escribir todo eso a mano llevaría un párrafo y aun así probablemente se perdería el Escarabajo. Microsoft archiva esto bajo “conocimiento del mundo y razonamiento”, y ese es el encuadre correcto: una referencia muy conocida es el token de prompt más comprimido que existe.
También es el menos controlable, y este ejemplo muestra exactamente dónde está el límite. Compara las dos imágenes: el origen es un chihuahua color crema, de pelo corto y orejas grandes y erguidas, sobre negro. El resultado es un perro blanco con marrón, con otro pelaje, otras proporciones y otras orejas. La referencia compró la escena. No preservó al sujeto.
Esa distinción es la lección práctica. La taquigrafía por referencia es excelente para establecer un mundo: un género, una época, una convención de luz, una distribución. Es poco confiable para la identidad. Si un rostro, una mascota, un producto o un empaque específico tiene que sobrevivir, ese requisito va en una descripción explícita o en un flujo con imagen de referencia, no en una alusión cultural.
Dos advertencias más que conviene tener presentes: una referencia solo funciona si el modelo la tiene, así que las referencias oscuras o regionales se degradan en silencio hacia un resultado genérico, y las imágenes famosas traen consideraciones de derechos que un prompt no resuelve por ti.
Por qué el renderizado de texto se volvió el número del titular
De todo lo del anuncio de 2.6, el número que Microsoft eligió destacar por separado fue el de texto: +91 Elo, por encima de la ganancia general de +79 Elo. Es un énfasis deliberado, y las muestras explican por qué.

Escribir bien un titular es la mitad fácil. El cartel de arriba además sostiene un topónimo francés con acentos, un asterisco en una calificación, una lista de fechas separadas por comas y —lo más importante— una jerarquía: la línea de fechas subordinada, el titular dominante y la ilustración quedándose con los dos tercios superiores. Un modelo que escribe perfecto pero le da el mismo peso a cada bloque de texto igual produce un diseño inservible.
Esta es la parte de la generación de imágenes más cercana al trabajo pagado, y por eso las citas de socios en la página de 2.5 giran alrededor de ella. Rob Reilly, director creativo global de WPP, señala la exactitud del texto como “un verdadero salto” junto a la edición en lenguaje natural; Vanessa Salvo, de Shutterstock, plantea que la métrica relevante es si los modelos “traducen la intención en resultados consistentes y listos para producción”. Empaques, carteles, menús y recursos de campaña fallan por tipografía antes que por fotorrealismo.
Qué te dice y qué no te dice un “n.º 2 en Arena”
Los resultados de Arena son comparaciones ciegas de preferencia humana, así que un salto grande de Elo es una señal real de que la gente prefirió esos resultados en un conjunto mixto de prompts. Es un resultado genuino, y +79 Elo en aproximadamente dos meses es una escalada rápida.
También es un único número agregado. El anuncio de Microsoft no publica valores de Elo por categoría, intervalos de confianza, el tamaño del conjunto de prompts ni la identidad del modelo que está arriba. Al 14 de agosto de 2026 siguen sin publicarse varias cosas que un equipo necesitaría antes de comprometer un pipeline:
- Precio de API por imagen para el nivel 2.6
- Resoluciones de salida nativa y máxima
- Cifras de latencia de generación y de edición
- Las capacidades de múltiples referencias y de anclaje descritas como “próximamente”
- Un informe técnico detrás de las diferencias de Elo
Nota
Un puesto general en Arena no puede decirte si un modelo sirve para tu trabajo específico. Un empaque cargado de texto en una escritura no latina, un rostro que debe repetirse en doce planos y un recurso transparente para la interfaz de un juego son tres pruebas distintas, y un modelo puede liderar el agregado y perder cualquiera de ellas.
La lectura honesta de 2.6 es acotada y aun así útil: Microsoft está iterando esta familia rápido, y apunta las ganancias al resultado comercial —texto, retratos, producto, marca— más que al espectáculo.
Cómo correr estos cuatro patrones en OmniArt
MAI-Image no está disponible hoy en el espacio de imagen de OmniArt. Los patrones de prompt sí, y son independientes del modelo. Elige según cuál de los cuatro trabajos es en realidad tu brief:
| El patrón | Para qué sirve | Punto de partida práctico en OmniArt |
|---|---|---|
| Prompt largo estructurado | Briefs donde se revisan vestuario, objetos, colores y cuentas | GPT Image 2 |
| Prompt corto apilado con un símil | Imágenes únicas cinematográficas y exploración de tono | Seedream 5.0 Pro |
| Edición de un cambio por turno | Variantes de color de producto, agregados, mudanzas controladas | Nano Banana 2 |
| Taquigrafía por referencia más identidad explícita | Construcción de escenas donde un sujeto debe mantenerse | Seedream 5.0 Pro con referencias |
| Iteración barata antes de comprometerse | Probar la estructura del prompt a bajo costo | Qwen Image |
Un ejercicio útil: toma el prompt de la azotea de más arriba, córrelo sin cambios y después córrelo de nuevo con los colores reemplazados por adjetivos ("a pink bottle", "a green wand") y la cuenta reemplazada por "some bubbles". La distancia entre esos dos resultados es el valor de la estructura, medido en tu modelo y no en una galería de lanzamiento.
Para un cara a cara actual sobre diseño y fotorrealismo, lee GPT Image 2 contra Nano Banana 2. Para consistencia guiada por referencias, la guía de lanzamiento de Seedream 5.0 Pro cubre su superficie de entrada y de control, y la guía de Qwen Image es la vía de bajo costo para los primeros borradores. Para leer un lanzamiento reciente comparable, Grok Imagine Image 2.0 hizo una afirmación parecida sobre Arena en la misma semana.
Preguntas frecuentes
¿Qué es MAI-Image-2.6?
MAI-Image-2.6 es el modelo de texto a imagen de Microsoft AI anunciado el 10 de agosto de 2026. Microsoft dice que quedó segundo en la tabla de texto a imagen de Arena, con una mejora de +79 Elo sobre MAI-Image-2.5 y de +91 Elo en renderizado de texto.
¿En qué se diferencia MAI-Image-2.6 de MAI-Image-2.5?
Microsoft describe ganancias en todas las categorías medidas de Arena, con énfasis específico en renderizado de texto, retratos e imágenes 3D, y en un resultado comercial y fotorrealista más pulido en producto, marca y trabajo cinematográfico. La entrada con varias referencias, el anclaje más rico y más control sobre razonamiento, formato y resolución se describen como próximos, sin detalle publicado.
¿Dónde puedo usar MAI-Image-2.6?
El anuncio de Microsoft dice que está disponible para texto a imagen en Arena, que llegaría a MAI Playground más adelante esa misma semana y que se está desplegando en Microsoft Foundry y otros productos.
¿MAI-Image está disponible en OmniArt?
No. MAI-Image no está en el selector de modelos de imagen de OmniArt. Los patrones de prompt de este artículo son independientes del modelo y se pueden correr en los modelos de imagen que OmniArt sí ofrece.
¿Qué es la familia de modelos MAI-Image-2.5?
Tres variantes: MAI-Image-2.5-Pro para consistencia de objetos y razonamiento visual, MAI-Image-2.5 para generación de alta calidad con edición controlable, y MAI-Image-2.5-Flash, descrito como listo para producción a menos de la mitad del precio del modelo insignia.
¿Estos patrones de prompt funcionan en otros modelos de imagen?
Sí. Los colores con nombre, las cuentas explícitas, un bloque de fondo cercado, un anclaje de escala, un cambio por edición y un símil compositivo son técnicas generales. Lo que cambia entre modelos es con cuánta fiabilidad se respeta cada una, y eso vale la pena probarlo en el modelo que de verdad usas.
Empezar en OmniArt
Abre el espacio de imagen de OmniArt y corre un brief por dos de los cuatro patrones de arriba: una versión larga estructurada y una versión corta apilada de la misma idea. Mantén el sujeto idéntico y cambia solo la forma del prompt. Esa sola comparación te va a decir más sobre tu modelo que cualquier puesto en una tabla.
De ahí en adelante, trata la edición como trabajo aparte: aprueba una imagen y después haz un cambio por prompt, revisando después de cada pasada los detalles que te importan. OmniArt mantiene los modelos de imagen, video, audio y música en un mismo espacio de trabajo, así que una fija aprobada puede pasar directo al movimiento sin cambiar de herramienta; y cuando un modelo nuevo se gane su lugar en el selector, los prompts que ya aprendiste a escribir se vienen contigo.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA