GuideModelos y análisis18 min de lectura

Prompts de MAI-Image-2.6: cuatro lecciones de Microsoft AI

MAI-Image-2.6 de Microsoft llegó al puesto n.º 2 de Arena. La parte más reutilizable del lanzamiento son los prompts publicados junto al modelo: cuatro estilos distintos, cuatro reglas que puedes aplicar a cualquier modelo de imagen.

Equipo OmniArt
Prompts de MAI-Image-2.6: cuatro lecciones de Microsoft AI

El 10 de agosto de 2026, Microsoft AI anunció MAI-Image-2.6 y dijo que quedó segundo en la tabla de texto a imagen de Arena, con una mejora de +79 Elo sobre MAI-Image-2.5 en general y de +91 Elo solo en renderizado de texto. Ese es el titular y, como casi todos los titulares de tablas de posiciones, vence rápido.

La parte del lanzamiento con vida más larga es más silenciosa: en las páginas de MAI-Image-2, MAI-Image-2.5 y MAI-Image-2.6, Microsoft publicó los prompts reales detrás de sus imágenes de muestra. Esos prompts no son un surtido al azar. Son cuatro formas claramente distintas de escribirle a un modelo de imagen, y cada una hace un trabajo específico: describir, comprimir, editar y referenciar.

MAI-Image no está en el selector de modelos de OmniArt, así que esto no es una reseña de un modelo que puedas correr acá. Es una lectura del oficio de escribir prompts que quedó a la vista, porque ese oficio se transfiere. Los cuatro patrones de abajo funcionan en cualquier modelo de imagen actual competente, y la lección de cada uno tiene la misma forma: lo que pones en el prompt determina qué falla te toca.

Qué lanzó Microsoft en MAI-Image 2, 2.5 y 2.6

Tres lanzamientos en menos de cinco meses, cada uno con un centro de gravedad distinto:

LanzamientoAnuncioPosicionamiento de MicrosoftAfirmación en Arena
MAI-Image-219 de marzo de 2026Fotorrealismo, texto dentro de la imagen, escenas ricas: “hecho con creativos”N.º 3 entre las familias de modelos
MAI-Image-2.5Página del modeloEdición precisa, fidelidad de materiales, salida consciente del diseño; variantes Pro / estándar / FlashTercero en texto a imagen, al 2 de junio de 2026
MAI-Image-2.610 de agosto de 2026Renderizado de texto, retratos y 3D, acabado comercial y cinematográficoSegundo en texto a imagen; +79 Elo sobre 2.5

MAI-Image-2.5 además se dividió en una familia: 2.5-Pro para consistencia de objetos y razonamiento visual, 2.5 para generación más edición controlable, y 2.5-Flash, que Microsoft describe como listo para producción a menos de la mitad del precio del modelo insignia. La página del modelo 2.5 grafica “Elo en Image Arena contra precio de API representativo por cada 1,000 imágenes”, lo que revela qué está optimizando el equipo: no solo la calidad máxima, sino la calidad por dólar.

Para 2.6, Microsoft dice que hay más que todavía no detalló: “trabajar con varias referencias y un anclaje más rico, hasta mayor control sobre razonamiento, formato y resolución”. Hasta que eso salga públicamente, es una declaración de hoja de ruta, no una especificación.

Lección 1: el prompt largo y estructurado le da a cada dato su propia casilla

El prompt detrás de la muestra de fotorrealismo de la página de MAI-Image-2.5 tiene unas 90 palabras, y su estructura es más interesante que su longitud:

A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.

Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

Una joven de perfil en una azotea soplando burbujas de jabón, con saco escolar azul marino, sosteniendo un frasco rosa fuerte y una varita verde lima, con edificios bajos bajo un cielo nublado detrás
Muestra de MAI-Image-2.5 publicada por Microsoft AI. Los colores nombrados y la cantidad de burbujas sobreviven en el resultado. Fuente: microsoft.ai.

Vuelve a leerlo como una forma y no como una oración. La primera oración es sujeto, pose, acción y cielo. La segunda es cabello y vestuario. La tercera son los objetos, uno por mano. La cuarta es un elemento contable. Después un bloque etiquetado —Behind her:— se lleva todo lo ambiental, y una directiva de estilo de dos palabras cierra el prompt.

Tres cosas de esa estructura hacen trabajo real:

  • Colores con nombre en vez de adjetivos. "Hot pink", "neon lime-green", "dark navy", "gold", "flat gray". No "bright", no "colourful". El nombre de un color es una restricción que el modelo puede cumplir o incumplir de forma visible; "vibrant" no lo es.
  • Un número en vez de un cuantificador. "Five iridescent bubbles of varying sizes" se puede verificar. "Some bubbles" no. En el resultado publicado la cuenta se sostiene: puedes pararte frente a la imagen y auditarla, que es exactamente el punto.
  • El fondo tiene su propio contenedor. Behind her: cerca el entorno para que su detalle no se filtre a la descripción del sujeto. Los prompts largos fallan cuando el modelo tiene que adivinar a qué sustantivo pertenece cada modificador.

La palabra de estilo aterriza al final, después del contenido, así que modifica una escena que ya está completamente especificada en vez de dirigir la composición.

Consejo

Escribe los prompts largos como casillas, no como prosa: sujeto y acción, después apariencia, después objetos, después detalle contable, después un bloque de entorno etiquetado, y al final el estilo. Si no puedes señalar a qué casilla pertenece una palabra, el modelo tampoco puede.

Lección 2: el prompt corto compra composición con un símil

El anuncio de MAI-Image-2 publicó un prompt muy distinto: unas 30 palabras, sin oraciones, solo cláusulas ordenadas por jerarquía:

A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

Una cueva de hielo azul abovedada fotografiada como la nave de una catedral, con una figura diminuta de chaqueta roja de pie al fondo entre la niebla
Muestra de MAI-Image-2 publicada por Microsoft AI. El símil es el que hace el trabajo de composición: el hielo llega como bóveda, arco y ábside iluminado. Fuente: microsoft.ai.

La primera cláusula es todo el truco. "Like a cathedral interior" no es decoración: es una instrucción de composición disfrazada de metáfora. Una catedral trae techo abovedado, una nave que se aleja, un arco, simetría y luz que entra desde el fondo. El resultado tiene los cinco, renderizados en hielo. Describir esa distribución de forma literal habría llevado treinta palabras y probablemente habría salido más rígido.

El segundo movimiento útil es tiny human figure at base for scale. La escala es lo que los modelos de imagen pierden con más facilidad, porque nada en una textura te dice qué tan grande es. Una referencia humana con nombre en una posición con nombre la fija en cuatro palabras, y la chaqueta roja del resultado hace más trabajo compositivo que cualquier cantidad de "epic, massive, enormous".

Los términos finales —cinematic, cold mist in air, hyper-real detail— son atmósfera y directivas de render, y van al final por la misma razón que la palabra de estilo en la lección 1.

Así que los dos prompts no son versiones mejor y peor de lo mismo. Son herramientas distintas:

Usa el prompt largo estructurado cuandoUsa el prompt corto apilado cuando
Importan vestuario, objetos o detalles de marca específicosQuieres una imagen fuerte y vas a iterar
Alguien va a revisar el resultado contra un briefEl tono importa más que el inventario
Necesitas reproducirlo más adelanteEstás explorando un aspecto
Las cuentas y los colores no se negocianUna buena analogía puede cargar la composición

Lección 3: en edición, un prompt debería hacer un solo cambio

La página de MAI-Image-2.5 demuestra la edición con tres prompts, y lo que destaca es lo chico que es cada uno:

Change the tote color to orange

Add peonies peeking out the tote

Edit this image to have the woman walking through the streets of New York City

Este es el primero, antes y después:

Una bolsa de lona beige lisa sobre una mesa rosa frente a una pared de ladrillo pintada de verde azulado oscuro, con luz de sol dura
Antes. Imagen de origen publicada por Microsoft AI en la página de MAI-Image-2.5.
La misma bolsa de lona en la misma posición y con la misma luz, ahora naranja brillante, con la pared de ladrillo verde azulado y la sombra proyectada sin cambios
Después de “Change the tote color to orange”. La pared verde azulada, la mesa rosa, la dirección del sol y la forma de la sombra sobreviven; el encuadre queda apenas más cerrado. Fuente: microsoft.ai.

El prompt tiene seis palabras: un verbo, un objeto nombrado, un valor objetivo. No pide además un fondo distinto, un ángulo nuevo ni mejor iluminación. Esa contención es la técnica, porque en una edición el trabajo más difícil del modelo es preservar, no cambiar. Todo lo que agregas a la instrucción es una cosa más que podría decidir rehacer.

Fíjate también en que el objeto está nombrado. "The tote" le da al modelo un referente inequívoco. "Make it orange" deja al modelo eligiendo entre la bolsa, la mesa y la pared.

El tercer prompt —mudar al sujeto a Nueva York— parece una operación mucho más grande, y lo es. Pero sigue siendo una operación, y sigue nombrando lo que debe persistir: "the woman". Un prompt de mudanza que además reestilizara su ropa y cambiara la hora del día no te dejaría forma de saber qué instrucción causó un mal resultado.

Advertencia

Una cadena de ediciones chicas también es una cadena de derivas chicas. Vuelve a revisar los detalles que te importan después de cada paso, no solo al final: el tono de piel, la geometría de un logo y el texto son lo primero que se degrada en silencio a lo largo de varias pasadas.

Lección 4: una referencia cultural es barata, y solo te compra la escena

El prompt publicado más corto tiene ocho palabras:

Chihuahua in Abbey Road album cover with moptop wig

Un chihuahua de pelo corto color crema con orejas grandes y erguidas, sentado contra un fondo negro liso
La imagen de origen publicada por Microsoft AI en la página de MAI-Image-2.5.
Un perro pequeño con peluca estilo moptop y lentes de sol cruzando un paso de cebra en una calle londinense arbolada, con un Volkswagen Escarabajo blanco estacionado a la izquierda y autos y peatones de época detrás
El resultado. La referencia reconstruye el paso de cebra, el Escarabajo blanco, la calle londinense y las figuras de época, pero el perro específico del origen no sobrevivió. Fuente: microsoft.ai.

Ocho palabras reconstruyen una escena muy específica: el paso de cebra, la calle arbolada que se aleja, el Volkswagen Escarabajo blanco estacionado a la izquierda, los autos de época, los peatones con abrigos sesenteros y el encuadre frontal plano. Escribir todo eso a mano llevaría un párrafo y aun así probablemente se perdería el Escarabajo. Microsoft archiva esto bajo “conocimiento del mundo y razonamiento”, y ese es el encuadre correcto: una referencia muy conocida es el token de prompt más comprimido que existe.

También es el menos controlable, y este ejemplo muestra exactamente dónde está el límite. Compara las dos imágenes: el origen es un chihuahua color crema, de pelo corto y orejas grandes y erguidas, sobre negro. El resultado es un perro blanco con marrón, con otro pelaje, otras proporciones y otras orejas. La referencia compró la escena. No preservó al sujeto.

Esa distinción es la lección práctica. La taquigrafía por referencia es excelente para establecer un mundo: un género, una época, una convención de luz, una distribución. Es poco confiable para la identidad. Si un rostro, una mascota, un producto o un empaque específico tiene que sobrevivir, ese requisito va en una descripción explícita o en un flujo con imagen de referencia, no en una alusión cultural.

Dos advertencias más que conviene tener presentes: una referencia solo funciona si el modelo la tiene, así que las referencias oscuras o regionales se degradan en silencio hacia un resultado genérico, y las imágenes famosas traen consideraciones de derechos que un prompt no resuelve por ti.

Por qué el renderizado de texto se volvió el número del titular

De todo lo del anuncio de 2.6, el número que Microsoft eligió destacar por separado fue el de texto: +91 Elo, por encima de la ganancia general de +79 Elo. Es un énfasis deliberado, y las muestras explican por qué.

Un cartel de evento con una ilustración en tonos morados de un caballo y su jinete en pleno salto, con la línea '13, 14, 15 Apr 2026 – Jumping International CSI 8* – Palais des Congrès d'Issy.' sobre el gran titular naranja 'SAINT FLASH'
Una muestra de tipografía de MAI-Image-2 publicada por Microsoft AI. Fíjate en los caracteres acentuados de 'Congrès d'Issy' y en la jerarquía intacta entre la línea de fechas y el titular. Fuente: microsoft.ai.

Escribir bien un titular es la mitad fácil. El cartel de arriba además sostiene un topónimo francés con acentos, un asterisco en una calificación, una lista de fechas separadas por comas y —lo más importante— una jerarquía: la línea de fechas subordinada, el titular dominante y la ilustración quedándose con los dos tercios superiores. Un modelo que escribe perfecto pero le da el mismo peso a cada bloque de texto igual produce un diseño inservible.

Esta es la parte de la generación de imágenes más cercana al trabajo pagado, y por eso las citas de socios en la página de 2.5 giran alrededor de ella. Rob Reilly, director creativo global de WPP, señala la exactitud del texto como “un verdadero salto” junto a la edición en lenguaje natural; Vanessa Salvo, de Shutterstock, plantea que la métrica relevante es si los modelos “traducen la intención en resultados consistentes y listos para producción”. Empaques, carteles, menús y recursos de campaña fallan por tipografía antes que por fotorrealismo.

Qué te dice y qué no te dice un “n.º 2 en Arena”

Los resultados de Arena son comparaciones ciegas de preferencia humana, así que un salto grande de Elo es una señal real de que la gente prefirió esos resultados en un conjunto mixto de prompts. Es un resultado genuino, y +79 Elo en aproximadamente dos meses es una escalada rápida.

También es un único número agregado. El anuncio de Microsoft no publica valores de Elo por categoría, intervalos de confianza, el tamaño del conjunto de prompts ni la identidad del modelo que está arriba. Al 14 de agosto de 2026 siguen sin publicarse varias cosas que un equipo necesitaría antes de comprometer un pipeline:

  • Precio de API por imagen para el nivel 2.6
  • Resoluciones de salida nativa y máxima
  • Cifras de latencia de generación y de edición
  • Las capacidades de múltiples referencias y de anclaje descritas como “próximamente”
  • Un informe técnico detrás de las diferencias de Elo

Nota

Un puesto general en Arena no puede decirte si un modelo sirve para tu trabajo específico. Un empaque cargado de texto en una escritura no latina, un rostro que debe repetirse en doce planos y un recurso transparente para la interfaz de un juego son tres pruebas distintas, y un modelo puede liderar el agregado y perder cualquiera de ellas.

La lectura honesta de 2.6 es acotada y aun así útil: Microsoft está iterando esta familia rápido, y apunta las ganancias al resultado comercial —texto, retratos, producto, marca— más que al espectáculo.

Cómo correr estos cuatro patrones en OmniArt

MAI-Image no está disponible hoy en el espacio de imagen de OmniArt. Los patrones de prompt sí, y son independientes del modelo. Elige según cuál de los cuatro trabajos es en realidad tu brief:

El patrónPara qué sirvePunto de partida práctico en OmniArt
Prompt largo estructuradoBriefs donde se revisan vestuario, objetos, colores y cuentasGPT Image 2
Prompt corto apilado con un símilImágenes únicas cinematográficas y exploración de tonoSeedream 5.0 Pro
Edición de un cambio por turnoVariantes de color de producto, agregados, mudanzas controladasNano Banana 2
Taquigrafía por referencia más identidad explícitaConstrucción de escenas donde un sujeto debe mantenerseSeedream 5.0 Pro con referencias
Iteración barata antes de comprometerseProbar la estructura del prompt a bajo costoQwen Image

Un ejercicio útil: toma el prompt de la azotea de más arriba, córrelo sin cambios y después córrelo de nuevo con los colores reemplazados por adjetivos ("a pink bottle", "a green wand") y la cuenta reemplazada por "some bubbles". La distancia entre esos dos resultados es el valor de la estructura, medido en tu modelo y no en una galería de lanzamiento.

Para un cara a cara actual sobre diseño y fotorrealismo, lee GPT Image 2 contra Nano Banana 2. Para consistencia guiada por referencias, la guía de lanzamiento de Seedream 5.0 Pro cubre su superficie de entrada y de control, y la guía de Qwen Image es la vía de bajo costo para los primeros borradores. Para leer un lanzamiento reciente comparable, Grok Imagine Image 2.0 hizo una afirmación parecida sobre Arena en la misma semana.

Preguntas frecuentes

¿Qué es MAI-Image-2.6?

MAI-Image-2.6 es el modelo de texto a imagen de Microsoft AI anunciado el 10 de agosto de 2026. Microsoft dice que quedó segundo en la tabla de texto a imagen de Arena, con una mejora de +79 Elo sobre MAI-Image-2.5 y de +91 Elo en renderizado de texto.

¿En qué se diferencia MAI-Image-2.6 de MAI-Image-2.5?

Microsoft describe ganancias en todas las categorías medidas de Arena, con énfasis específico en renderizado de texto, retratos e imágenes 3D, y en un resultado comercial y fotorrealista más pulido en producto, marca y trabajo cinematográfico. La entrada con varias referencias, el anclaje más rico y más control sobre razonamiento, formato y resolución se describen como próximos, sin detalle publicado.

¿Dónde puedo usar MAI-Image-2.6?

El anuncio de Microsoft dice que está disponible para texto a imagen en Arena, que llegaría a MAI Playground más adelante esa misma semana y que se está desplegando en Microsoft Foundry y otros productos.

¿MAI-Image está disponible en OmniArt?

No. MAI-Image no está en el selector de modelos de imagen de OmniArt. Los patrones de prompt de este artículo son independientes del modelo y se pueden correr en los modelos de imagen que OmniArt sí ofrece.

¿Qué es la familia de modelos MAI-Image-2.5?

Tres variantes: MAI-Image-2.5-Pro para consistencia de objetos y razonamiento visual, MAI-Image-2.5 para generación de alta calidad con edición controlable, y MAI-Image-2.5-Flash, descrito como listo para producción a menos de la mitad del precio del modelo insignia.

¿Estos patrones de prompt funcionan en otros modelos de imagen?

Sí. Los colores con nombre, las cuentas explícitas, un bloque de fondo cercado, un anclaje de escala, un cambio por edición y un símil compositivo son técnicas generales. Lo que cambia entre modelos es con cuánta fiabilidad se respeta cada una, y eso vale la pena probarlo en el modelo que de verdad usas.

Empezar en OmniArt

Abre el espacio de imagen de OmniArt y corre un brief por dos de los cuatro patrones de arriba: una versión larga estructurada y una versión corta apilada de la misma idea. Mantén el sujeto idéntico y cambia solo la forma del prompt. Esa sola comparación te va a decir más sobre tu modelo que cualquier puesto en una tabla.

De ahí en adelante, trata la edición como trabajo aparte: aprueba una imagen y después haz un cambio por prompt, revisando después de cada pasada los detalles que te importan. OmniArt mantiene los modelos de imagen, video, audio y música en un mismo espacio de trabajo, así que una fija aprobada puede pasar directo al movimiento sin cambiar de herramienta; y cuando un modelo nuevo se gane su lugar en el selector, los prompts que ya aprendiste a escribir se vienen contigo.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis