MAI-Image-2.6-Prompts: vier Lektionen von Microsoft
Microsofts MAI-Image-2.6 ist auf Platz 2 der Arena eingestiegen. Der haltbarere Teil dieser Veröffentlichung sind die Prompts, die daneben veröffentlicht wurden: vier Schreibweisen, vier übertragbare Regeln.

Am 10. August 2026 hat Microsoft AI MAI-Image-2.6 angekündigt und erklärt, das Modell liege auf Platz zwei der Arena-Bestenliste für Text-zu-Bild — insgesamt +79 Elo gegenüber MAI-Image-2.5, und allein beim Textrendering +91 Elo. Das ist die Schlagzeile, und Schlagzeilen aus Bestenlisten verfallen bekanntlich schnell.
Der Teil mit der längeren Haltbarkeit ist leiser: Auf den Seiten zu MAI-Image-2, MAI-Image-2.5 und MAI-Image-2.6 hat Microsoft die tatsächlichen Prompts hinter den Beispielbildern veröffentlicht. Diese Prompts sind keine zufällige Sammlung. Es sind vier deutlich unterschiedliche Arten, für ein Bildmodell zu schreiben, und jede erledigt eine eigene Aufgabe: beschreiben, verdichten, bearbeiten, zitieren.
MAI-Image steht in OmniArt nicht zur Auswahl, das hier ist also kein Test eines Modells, das du bei uns starten kannst. Es ist eine Lektüre des Prompt-Handwerks, das dort sichtbar wird — denn dieses Handwerk lässt sich übertragen. Die vier Muster unten funktionieren mit jedem leistungsfähigen aktuellen Bildmodell, und die Lektion hat jedes Mal dieselbe Form: Was du in den Prompt schreibst, entscheidet darüber, welchen Fehler du bekommst.
Was MAI-Image 2, 2.5 und 2.6 jeweils gebracht haben
Drei Veröffentlichungen in weniger als fünf Monaten, jede mit einem anderen Schwerpunkt:
| Version | Angekündigt | Microsofts Positionierung | Arena-Aussage |
|---|---|---|---|
| MAI-Image-2 | 19. März 2026 | Fotorealismus, Text im Bild, dichte Szenen — „mit Kreativen entwickelt“ | Platz 3 als Modellfamilie |
| MAI-Image-2.5 | Modellseite | Präzise Bearbeitung, Materialtreue, designtaugliche Ergebnisse; Pro / Standard / Flash | Platz 3 bei Text-zu-Bild, Stand 2. Juni 2026 |
| MAI-Image-2.6 | 10. August 2026 | Textrendering, Porträts und 3D, kommerzieller und filmischer Feinschliff | Platz 2 bei Text-zu-Bild; +79 Elo gegenüber 2.5 |
MAI-Image-2.5 hat sich außerdem in eine Familie aufgeteilt: 2.5-Pro für Objektkonsistenz und visuelles Schlussfolgern, 2.5 für Generierung plus steuerbare Bearbeitung und 2.5-Flash, das Microsoft als produktionsreif zu weniger als der Hälfte des Preises des Spitzenmodells beschreibt. Die Modellseite von 2.5 zeigt ein Diagramm „Image Arena Elo vs. repräsentativer API-Preis pro 1.000 Bilder“ — und das verrät, worauf das Team optimiert: nicht auf die reine Spitzenqualität, sondern auf Qualität pro Euro.
Zu 2.6 sagt Microsoft, es gebe noch mehr, das bislang nicht ausgeführt wurde — „vom Arbeiten über mehrere Referenzen hinweg und reicherem Grounding bis zu mehr Kontrolle über Reasoning, Format und Auflösung“. Solange das nicht öffentlich verfügbar ist, ist es eine Roadmap-Aussage und keine Spezifikation.
Lektion 1: Der lange strukturierte Prompt gibt jedem Fakt sein eigenes Fach
Der Prompt hinter dem Fotorealismus-Beispiel auf der Seite zu MAI-Image-2.5 umfasst rund 90 Wörter, und sein Aufbau ist interessanter als seine Länge:
A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.
Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

Lies ihn noch einmal als Formular statt als Fließtext. Satz eins: Motiv, Haltung, Handlung, Himmel. Satz zwei: Haare und Kleidung. Satz drei: Requisiten, eine pro Hand. Satz vier: ein zählbares Element. Dann ein beschrifteter Block — Behind her: — der alles Umgebungsbezogene aufnimmt, und eine Stilangabe aus zwei Wörtern schließt den Prompt ab.
Drei Dinge in diesem Aufbau leisten echte Arbeit:
- Farbnamen statt Adjektive. „hot pink“, „neon lime-green“, „dark navy“, „gold“, „flat gray“. Nicht „hell“, nicht „farbenfroh“. Ein Farbname ist eine Vorgabe, die das Modell erfüllen oder sichtbar verfehlen kann; „vibrant“ ist das nicht.
- Eine Zahl statt einer Mengenangabe. „Five iridescent bubbles of varying sizes“ lässt sich nachprüfen, „some bubbles“ nicht. Im veröffentlichten Ergebnis stimmt die Anzahl — du kannst vor dem Bild stehen und nachzählen, und genau darum geht es.
- Der Hintergrund bekommt einen eigenen Behälter.
Behind her:zäunt die Umgebung ein, damit ihre Details nicht in die Motivbeschreibung sickern. Lange Prompts scheitern dort, wo das Modell raten muss, zu welchem Substantiv ein Attribut gehört.
Das Stilwort steht am Ende, nach dem Inhalt, und wirkt damit auf eine bereits vollständig festgelegte Szene, statt selbst die Komposition zu steuern.
Tipp
Schreibe lange Prompts als Fächer, nicht als Prosa: Motiv und Handlung, dann Aussehen, dann Requisiten, dann zählbare Details, dann ein beschrifteter Umgebungsblock, dann Stil. Wenn du selbst nicht zeigen kannst, in welches Fach ein Wort gehört, kann das Modell es auch nicht.
Lektion 2: Der kurze Prompt kauft die Komposition mit einem Vergleich
Die Ankündigung zu MAI-Image-2 hat einen ganz anderen Prompt veröffentlicht — rund 30 Wörter, keine Sätze, nur nach Wichtigkeit sortierte Wortgruppen:
A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

Die erste Wortgruppe ist der ganze Trick. „Like a cathedral interior“ ist keine Verzierung, sondern eine Kompositionsanweisung im Gewand einer Metapher. Eine Kathedrale bringt ein Gewölbe mit, ein Schiff, das nach hinten fluchtet, einen Bogen, Symmetrie und Licht, das vom hinteren Ende hereinfällt. Das Ergebnis hat alle fünf, in Eis ausgeführt. Dieses Layout wörtlich zu beschreiben hätte dreißig Wörter gebraucht und wäre vermutlich steifer geworden.
Der zweite nützliche Zug ist tiny human figure at base for scale. Größenverhältnisse verliert ein Bildmodell am zuverlässigsten, weil keine Textur verrät, wie groß sie ist. Ein benannter menschlicher Bezugspunkt an einer benannten Position fixiert das in vier Wörtern, und die rote Jacke im Ergebnis leistet mehr Kompositionsarbeit als jede Menge „epic, massive, enormous“.
Die letzten Begriffe — cinematic, cold mist in air, hyper-real detail — sind Atmosphäre und Rendering-Anweisungen und stehen aus demselben Grund am Ende wie das Stilwort in Lektion 1.
Die beiden Prompts sind also keine bessere und schlechtere Fassung derselben Sache. Es sind unterschiedliche Werkzeuge:
| Nimm den langen strukturierten Prompt, wenn | Nimm den kurzen gestapelten Prompt, wenn |
|---|---|
| Kleidung, Requisiten oder Markendetails zählen | du ein starkes Bild willst und dann iterierst |
| jemand das Ergebnis gegen ein Briefing prüft | die Stimmung wichtiger ist als die Inventarliste |
| du es später reproduzieren musst | du einen Look erkundest |
| Anzahl und Farben nicht verhandelbar sind | ein guter Vergleich die Komposition tragen kann |
Lektion 3: Beim Bearbeiten sollte ein Prompt eine Sache ändern
Die Seite zu MAI-Image-2.5 zeigt Bearbeitung anhand von drei Prompts, und auffällig ist, wie klein jeder einzelne ist:
Change the tote color to orange
Add peonies peeking out the tote
Edit this image to have the woman walking through the streets of New York City
Hier der erste, vorher und nachher:


Der Prompt hat sechs Wörter: ein Verb, ein benanntes Objekt, ein Zielwert. Er verlangt nicht nebenbei einen anderen Hintergrund, einen neuen Winkel oder besseres Licht. Diese Zurückhaltung ist die eigentliche Technik, denn bei einer Bearbeitung ist die schwerste Aufgabe des Modells das Bewahren, nicht das Verändern. Alles, was du der Anweisung hinzufügst, ist eine weitere Sache, die es neu machen könnte.
Beachte außerdem, dass das Objekt benannt wird. „The tote“ gibt dem Modell einen eindeutigen Bezug. „Mach es orange“ lässt das Modell zwischen Tasche, Tisch und Wand wählen.
Der dritte Prompt — das Motiv nach New York versetzen — sieht nach einem viel größeren Eingriff aus, und das ist er auch. Aber es bleibt ein Eingriff, und er benennt weiterhin, was erhalten bleiben muss: „the woman“. Ein Prompt, der zusätzlich das Outfit umgestaltet und die Tageszeit ändert, lässt dir keine Möglichkeit zu erkennen, welche Anweisung das schlechte Ergebnis verursacht hat.
Warnung
Eine Kette kleiner Bearbeitungen ist auch eine Kette kleiner Abweichungen. Prüfe die Details, auf die es dir ankommt, nach jedem Schritt und nicht erst am Ende — Hauttöne, Logo-Geometrie und Text sind das Erste, was über mehrere Durchgänge still verfällt.
Lektion 4: Ein kultureller Verweis ist billig — und kauft nur die Szene
Der kürzeste veröffentlichte Prompt hat acht Wörter:
Chihuahua in Abbey Road album cover with moptop wig


Acht Wörter rekonstruieren eine sehr bestimmte Szene: den Zebrastreifen, die fluchtende Baumallee, den links geparkten weißen VW Käfer, zeitgenössische Autos, Passanten in Sechzigerjahre-Mänteln und die flache frontale Kadrierung. Das auszuschreiben bräuchte einen Absatz und würde den Käfer wahrscheinlich trotzdem verfehlen. Microsoft ordnet das unter „Weltwissen und Schlussfolgern“ ein, und das trifft es: Ein bekannter Verweis ist der am stärksten verdichtete Prompt, den es gibt.
Er ist zugleich der am wenigsten steuerbare, und dieses Beispiel zeigt genau, wo die Grenze liegt. Vergleiche die beiden Bilder: Die Vorlage ist ein cremefarbener, kurzhaariger Chihuahua mit großen aufrechten Ohren vor Schwarz. Das Ergebnis ist ein weiß-brauner Hund mit anderem Fell, anderen Proportionen und anderen Ohren. Der Verweis hat die Szene gekauft. Das Motiv hat er nicht bewahrt.
Diese Unterscheidung ist die praktische Lektion. Verweis-Kurzschrift eignet sich hervorragend, um eine Welt aufzuspannen — ein Genre, eine Epoche, eine Lichtkonvention, ein Layout. Für Identität ist sie unzuverlässig. Wenn ein bestimmtes Gesicht, Haustier, Produkt oder eine bestimmte Verpackung erhalten bleiben muss, gehört diese Anforderung in eine ausdrückliche Beschreibung oder in einen Referenzbild-Ablauf, nicht in eine kulturelle Anspielung.
Zwei weitere Vorbehalte lohnen sich: Ein Verweis funktioniert nur, wenn das Modell ihn kennt — abseitige oder regionale Verweise verfallen still ins Generische. Und bekannte Bildwelten bringen Rechtefragen mit, die ein Prompt dir nicht abnimmt.
Warum Textrendering zur Schlagzeile wurde
Von allem in der 2.6-Ankündigung hat Microsoft ausgerechnet die Zahl zum Text separat herausgestellt: +91 Elo, über dem Gesamtzuwachs von +79 Elo. Das ist eine bewusste Gewichtung, und die Beispiele erklären, warum.

Eine Schlagzeile richtig zu schreiben ist die leichtere Hälfte. Das Plakat oben hält außerdem einen französischen Ortsnamen mit Akzenten, ein Sternchen in einer Wertung, eine mit Kommas getrennte Datumsreihe und — am wichtigsten — eine Hierarchie: Datumszeile untergeordnet, Schlagzeile dominant, Illustration mit den oberen zwei Dritteln. Ein Modell, das fehlerfrei schreibt, aber jedem Textblock dasselbe visuelle Gewicht gibt, liefert trotzdem ein unbrauchbares Layout.
Das ist der Teil der Bildgenerierung, der bezahlter Arbeit am nächsten kommt, und deshalb kreisen auch die Partnerzitate auf der 2.5-Seite darum. WPPs Global Chief Creative Officer Rob Reilly hebt Textgenauigkeit neben der Bearbeitung per natürlicher Sprache als „echten Durchbruch“ hervor; Vanessa Salvo von Shutterstock formuliert den entscheidenden Maßstab als die Frage, ob Modelle „Absicht in konsistente, produktionsreife Ergebnisse übersetzen“. Verpackungen, Plakate, Speisekarten und Kampagnenmotive scheitern an der Typografie, bevor sie am Fotorealismus scheitern.
Was „Platz 2 der Arena“ aussagt — und was nicht
Arena-Ergebnisse sind blinde menschliche Präferenzvergleiche, ein großer Elo-Sprung ist also ein echtes Signal dafür, dass Menschen die Ergebnisse über eine gemischte Promptmenge hinweg bevorzugt haben. Das Resultat ist real, und +79 Elo in rund zwei Monaten sind ein schneller Anstieg.
Es ist aber auch nur eine einzelne Kennzahl. Microsofts Ankündigung veröffentlicht weder Elo-Werte je Kategorie noch Konfidenzintervalle, weder die Größe der Promptmenge noch den Namen des Modells darüber. Stand 14. August 2026 fehlen mehrere Angaben, die ein Team vor einer Pipeline-Entscheidung bräuchte:
- API-Preis pro Bild für die 2.6-Stufe
- Native und maximale Ausgabeauflösung
- Latenzwerte für Generierung und Bearbeitung
- Die als „demnächst“ beschriebenen Multi-Referenz- und Grounding-Fähigkeiten
- Ein technischer Bericht hinter den Elo-Differenzen
Hinweis
Ein Gesamtrang in der Arena sagt nichts darüber, ob ein Modell zu deiner konkreten Aufgabe passt. Textlastige Verpackung in nichtlateinischer Schrift, ein Gesicht, das über zwölf Aufnahmen gleich bleiben muss, und ein transparentes Asset für ein Spiel-UI sind drei verschiedene Prüfungen — und ein Modell kann in der Summe führen und jede einzelne davon verlieren.
Die ehrliche Lesart von 2.6 ist eng und trotzdem brauchbar: Microsoft iteriert diese Familie schnell und richtet die Zuwächse auf kommerzielle Ergebnisse aus — Text, Porträts, Produkt, Marke — statt auf Schauwerte.
Diese vier Muster in OmniArt anwenden
MAI-Image steht derzeit nicht im Bild-Workspace von OmniArt zur Verfügung. Die Prompt-Muster schon, und sie sind modellunabhängig. Wähle danach, welche der vier Aufgaben dein Briefing tatsächlich ist:
| Das Muster | Wofür es gedacht ist | Ein praktischer Startpunkt in OmniArt |
|---|---|---|
| Langer strukturierter Prompt | Briefings, bei denen Kleidung, Requisiten, Farben und Anzahl geprüft werden | GPT Image 2 |
| Kurzer gestapelter Prompt mit Vergleich | Filmische Einzelbilder und Stimmungssuche | Seedream 5.0 Pro |
| Bearbeitung mit einer Änderung pro Durchgang | Produktfarben, Ergänzungen, kontrollierter Ortswechsel | Nano Banana 2 |
| Verweis-Kurzschrift plus ausdrückliche Identität | Weltaufbau, bei dem ein Motiv konsistent bleiben muss | Seedream 5.0 Pro mit Referenzbildern |
| Günstiges Iterieren vor der Festlegung | Promptstrukturen preiswert testen | Qwen Image |
Eine nützliche Übung: Nimm den Dach-Prompt von oben, lass ihn unverändert laufen, und dann noch einmal mit Adjektiven statt Farbnamen („a pink bottle“, „a green wand“) und „some bubbles“ statt der Zahl. Der Abstand zwischen beiden Ergebnissen ist der Wert der Struktur — gemessen an deinem Modell und nicht an einer Launch-Galerie.
Für einen aktuellen Direktvergleich zu Layout und Fotorealismus siehe GPT Image 2 vs. Nano Banana 2. Zur referenzgestützten Konsistenz beschreibt der Seedream-5.0-Pro-Launchguide Eingaben und Steuerung, und der Qwen-Image-Guide ist der günstige Weg für frühe Entwürfe. Als vergleichbare Launch-Analyse hat Grok Imagine Image 2.0 in derselben Woche eine ähnliche Arena-Aussage gemacht.
FAQ
Was ist MAI-Image-2.6?
MAI-Image-2.6 ist das am 10. August 2026 angekündigte Text-zu-Bild-Modell von Microsoft AI. Microsoft gibt an, es liege auf Platz zwei der Arena-Bestenliste für Text-zu-Bild, mit +79 Elo gegenüber MAI-Image-2.5 und +91 Elo beim Textrendering.
Wie unterscheidet sich MAI-Image-2.6 von MAI-Image-2.5?
Microsoft beschreibt Zuwächse in jeder gemessenen Arena-Kategorie, mit besonderem Gewicht auf Textrendering, Porträts und 3D sowie stärker ausgearbeiteten kommerziellen und fotorealistischen Ergebnissen in Produkt-, Marken- und filmischer Arbeit. Multi-Referenz-Eingaben, reicheres Grounding und mehr Kontrolle über Reasoning, Format und Auflösung werden als kommend beschrieben, ohne veröffentlichte Details.
Wo kann ich MAI-Image-2.6 nutzen?
Laut Microsofts Ankündigung ist es für Text-zu-Bild in der Arena verfügbar, kommt später in derselben Woche in den MAI Playground und wird anschließend über Microsoft Foundry und weitere Produkte ausgerollt.
Gibt es MAI-Image in OmniArt?
Nein. MAI-Image steht in der Bildmodell-Auswahl von OmniArt nicht zur Verfügung. Die Prompt-Muster aus diesem Artikel sind modellunabhängig und lassen sich mit den Bildmodellen nutzen, die OmniArt anbietet.
Was umfasst die MAI-Image-2.5-Familie?
Drei Varianten: MAI-Image-2.5-Pro für Objektkonsistenz und visuelles Schlussfolgern, MAI-Image-2.5 für hochwertige Generierung mit steuerbarer Bearbeitung und MAI-Image-2.5-Flash, beschrieben als produktionsreif zu weniger als der Hälfte des Preises des Spitzenmodells.
Funktionieren diese Prompt-Muster auch bei anderen Modellen?
Ja. Farbnamen, ausdrückliche Anzahlen, ein abgegrenzter Hintergrundblock, ein Größenbezug, eine Änderung pro Bearbeitung und ein kompositorischer Vergleich sind allgemeine Prompt-Techniken. Zwischen Modellen unterscheidet sich, wie zuverlässig jede davon eingehalten wird — das lohnt sich mit dem Modell zu testen, das du tatsächlich verwendest.
Loslegen mit OmniArt
Öffne den OmniArt-Bild-Workspace und lass ein Briefing durch zwei der vier Muster oben laufen — eine lange strukturierte und eine kurze gestapelte Fassung derselben Idee. Halte das Motiv identisch und ändere nur die Prompt-Form. Dieser eine Vergleich sagt dir mehr über dein Modell als jede Position in einer Bestenliste.
Behandle Bearbeitung danach als eigene Arbeit: ein Bild freigeben, dann eine Änderung pro Prompt, und nach jedem Durchgang die Details prüfen, auf die es dir ankommt. OmniArt hält Bild-, Video-, Audio- und Musikmodelle in einem Workspace, ein freigegebenes Standbild kann also direkt in Bewegung übergehen, ohne dass du das Werkzeug wechselst — und wenn ein neues Modell seinen Platz in der Auswahl verdient, kommen die Prompts, die du schreiben gelernt hast, einfach mit.
Bereit zum Erstellen?
Starte mit KI die Erstellung beeindruckender Inhalte