tipsArtikel und Tipps12 Min. Lesezeit

7 Prompt-Korrekturen, wenn Ihr KI-Video falsch herauskommt

KI-Video-Fehlersuche nach Symptom: sieben Prompt-Korrekturen für verzerrte Gesichter, ignorierte Aktionen, driftende Szenen, entstellten Text, Ruckeln und schiefe Lippensynchronität.

OmniArt-Team
7 Prompt-Korrekturen, wenn Ihr KI-Video falsch herauskommt

Die meisten misslungenen KI-Videoclips sind kein Modellproblem. Sie sind ein Prompt mit einem bestimmten Defekt, und dieser Defekt hinterlässt einen Fingerabdruck: Hände, die zerlaufen, ein Motiv, das stillsteht, eine Kamera, die sich nie bewegt, eine Jacke, die auf halbem Weg die Farbe wechselt. Sobald Sie den Fingerabdruck lesen können, kostet jede der Prompt-Korrekturen unten genau eine Änderung.

Dieser Artikel ist nach Symptomen sortiert und nicht nach Prinzipien. Wenn Sie die Grundlagen wollen — Motiv, Stil, Licht, Komposition —, beginnen Sie mit wie Sie bessere Prompts schreiben und kommen Sie hierher zurück, wenn eine konkrete Generierung aus dem Ruder läuft. Alles unten setzt voraus, dass Sie schon vernünftige Prompts schreiben und wissen wollen, welches Wort Sie ändern müssen, wenn ein Clip scheitert.

Die Beispiele nutzen Modelle, die im Video-Workspace von OmniArt verfügbar sind — Seedance, Veo 3.1, Kling, Grok Imagine, PixVerse V6 und C1 —, denn Teil der Fehlersuche ist zu erkennen, wann ein Symptom besser mit einem anderen Modell gelöst wird als mit noch mehr Prompt-Text.

Immer nur eine Variable ändern

Vor den einzelnen Korrekturen die Gewohnheit, die alle davon schneller macht: eine Änderung pro Generierung. Den ganzen Prompt nach einem schlechten Versuch umzuschreiben lehrt Sie nichts, weil Sie nicht erkennen können, welche Änderung geholfen hat.

Dauer, Auflösung, Seitenverhältnis und Referenzbilder beeinflussen das Ergebnis genauso stark wie die Formulierung, notieren Sie die Einstellungen also zusammen mit dem Prompt-Text. Zwei oder drei bewusste Durchgänge schlagen meist zehn Umschreibungen.

Tipp

Kürzen Sie zuerst den Clip. Ein großer Teil der Bewegungs- und Anatomiefehler verschwindet, wenn Sie vier Sekunden mit einer Aktion verlangen statt acht Sekunden mit drei Aktionen.

Korrektur 1: Gesichter, Hände und Gliedmaßen verzerren mitten im Clip

Was Sie sehen: Das erste Bild sieht sauber aus, dann verschmelzen Finger, ein Gesicht rutscht vom Schädel oder während einer Drehung erscheint ein zusätzlicher Arm.

Warum es passiert: Das Modell interpoliert einen Körper durch Positionen, die Ihr Prompt nie beschrieben hat. Schnelle Bewegung der Gliedmaßen, enge Rahmung auf Hände, Verdeckung (eine Hand, die vor einem Gesicht vorbeigeht) und lange Dauer vervielfachen alle die Anzahl der Bilder, die das Modell erfinden muss.

Die Korrektur: Reduzieren Sie, was erfunden werden muss. Gehen Sie mit der Rahmung eine Größe zurück, benennen Sie die Körpermechanik ausdrücklich und halten Sie die Hände entweder still oder auf einer einfachen Bahn. Von einem sauberen Bild statt von Text zu starten verankert die Anatomie ebenfalls, denn das Modell erbt einen korrekten Körper, anstatt einen zu erraten.

Vorher: „Nahaufnahme der Hände eines Kochs, der schnell Gemüse schneidet und in eine Pfanne wirft.“

Nachher: „Halbnahe Aufnahme eines Kochs an einer Holztheke. Eine gleichmäßige Schneidebewegung mit der rechten Hand, die linke Hand liegt flach auf dem Brett. Die Hände bleiben im Bild, keine Schnitte. 50 mm, weiches Fensterlicht von links aus Kamerasicht.“

Bei Aufnahmen mit Menschen im Zentrum halten Veo 3.1 und Kling die Körperstruktur über eine ganze Einstellung meist gut, und Bild-zu-Video schlägt bei jedem Modell Text-zu-Video, wenn die Anatomie der Schwachpunkt ist. Wenn Sie die Nahaufnahme behalten müssen, kürzen Sie den Clip und akzeptieren Sie eine Bewegung statt zwei.

Korrektur 2: Das Motiv ignoriert die Aktion, die Sie verlangt haben

Was Sie sehen: Rahmung, Licht und Stil passen alle zu Ihrem Prompt, aber das Motiv steht nur atmend da oder führt irgendeine generische Leerlaufbewegung aus statt der Aktion, die Sie angegeben haben.

Warum es passiert: Die Aktion ist begraben. Wenn das Verb am Ende eines langen beschreibenden Satzes steht oder mit drei anderen Verben konkurriert, behandelt das Modell es als ein weiteres Attribut einer stillen Szene. Vage Verben („interagieren“, „genießen“, „erkunden“) haben überhaupt keine visuelle Form, also passiert nichts.

Die Korrektur: Setzen Sie Motiv und Aktion nach vorn, verwenden Sie ein konkretes physisches Verb im Präsens und beschreiben Sie den Endpunkt der Aktion. Verschieben Sie alles Stilistische — Objektiv, Farbpalette, Stimmung — hinter die Aktion, damit es als Verzierung und nicht als Hauptsatz gelesen wird.

Vorher: „Eine dramatische, düstere, regennasse Gasse bei Nacht mit Neonspiegelungen und Dampf, in der eine Kurierfahrerin die Gegend erkundet und mit ihrer Umgebung interagiert.“

Nachher: „Eine Kurierfahrerin geht in die Hocke und hebt einen fallengelassenen Umschlag auf, dann steht sie auf und schaut nach links. Regennasse Gasse bei Nacht, Neonspiegelungen auf nassem Asphalt, Dampf aus einem Schacht. Halbnahe Handkamera-Aufnahme.“

Seedance reagiert gut auf diese Art von Shotlist-Formulierung, und PixVerse C1 ist eine sinnvolle Wahl, wenn das Briefing ein kontrollierter Bewegungsmoment ist — eine Drehung, ein Griff oder eine Produktenthüllung.

Korrektur 3: Die Kamerabewegung passiert nicht oder kämpft gegen das Motiv

Was Sie sehen: Sie haben eine Dolly-Fahrt nach vorn verlangt und ein festes Bild bekommen. Oder die Kamera bewegt sich, aber das Motiv gleitet merkwürdig gegen den Hintergrund, und die Aufnahme fühlt sich an wie ein verzerrtes Foto statt wie eine Bewegung durch den Raum.

Warum es passiert: Zwei Ursachen, und sie sehen ähnlich aus. Entweder ist die Bewegung als Effekt ohne Motivation angegeben („heranzoomen“, „filmische Kamerabewegung“), oder Sie haben widersprüchliche Anweisungen gestapelt — ein Heranfahren, während das Motiv auf die Kamera zugeht, oder ein Schwenk plus eine Neigung plus eine Kranfahrt in einem Vier-Sekunden-Clip.

Die Korrektur: Eine Kamerabewegung pro Clip, in Filmsprache benannt, an etwas gebunden, das im Bild geschieht. Dann auf Konflikte prüfen: Wenn sich das Motiv auf das Objektiv zubewegt, sollte die Kamera halten oder zurückweichen, nicht nachdrücken.

Vorher: „Epische filmische Kamerabewegung, heranzoomen und um den Helden herumschwenken, während er auf die Kamera zuläuft, dynamische Winkel.“

Nachher: „Der Held läuft einen Korridor hinunter auf die Kamera zu. Die Kamera weicht in gleichmäßigem Tempo vor ihm zurück und hält ihn in halbnaher Rahmung. Untersicht, Weitwinkelobjektiv, keine weitere Kamerabewegung.“

Kling und Seedance nehmen ausdrückliche Kameraanweisungen beide gut auf, und Grok Imagine ist einen Versuch wert für lockerere, energische Bewegungen, bei denen exakte Rahmung weniger zählt als das Gefühl. Wenn eine Bewegung sich weiterhin verweigert, beschreiben Sie die Veränderung in dem, was der Betrachter sieht — „die Skyline tritt von unten ins Bild“ — statt die Technik zu benennen.

Korrektur 4: Die Szene driftet oder die Identität wechselt mitten im Clip

Was Sie sehen: Das Motiv beginnt als eine Person und endet als deren Cousin. Eine rote Jacke wird bordeauxrot, ein Ladengeschäft im Hintergrund sortiert sich neu, der Raum bekommt ein zweites Fenster.

Warum es passiert: Nichts in der Generierung pinnt das Aussehen fest. Textprompts beschreiben eine Kategorie und kein Individuum, also ist jedes Bild frei, „junge Frau in roter Jacke“ etwas anders zu interpretieren. Längere Dauer und unruhige Hintergründe beschleunigen das Driften.

Die Korrektur: Mit einem Bild verankern und dann nur beschreiben, was sich ändert. Wenn Sie eine Referenz oder ein Startbild hochladen, schadet es aktiv, das gesamte Aussehen im Prompt zu wiederholen — der Text konkurriert dann mit dem Bild. Halten Sie den Hintergrund einfach und teilen Sie lange Ideen in mehrere kurze Aufnahmen statt in eine lange Einstellung.

Vorher: „Eine junge Frau in roter Jacke mit braunen Haaren geht durch einen belebten Markt, 10 Sekunden, viele Details, viele Menschen und Stände.“

Nachher: „Behalte Gesicht, Haare und rote Jacke des referenzierten Motivs unverändert. Sie geht an zwei Ständen vorbei nach vorn und bleibt stehen, um nach rechts zu schauen. Geringe Schärfentiefe, damit der Markt hinter ihr weich bleibt. 5 Sekunden, eine durchgehende Aufnahme.“

Hinweis

Referenz-Workflows unterscheiden sich je Modell. PixVerse C1 unterstützt referenzgeführte Bewegung und Übergänge von Anfangs- zu Endbild, wenn beide Kompositionen zählen, und PixVerse V6 unterstützt Sequenzen aus mehreren Aufnahmen. Prüfen Sie im Composer, was das gewählte Modell anbietet, bevor Sie einen Prompt schreiben, der davon abhängt.

Korrektur 5: Text und Logos kommen entstellt heraus

Was Sie sehen: ein Schild, auf dem „SHOPP“ steht, ein Produktetikett, das sich in Pseudo-Buchstaben auflöst, ein Logo, das alle paar Bilder mutiert.

Warum es passiert: Videomodelle erzeugen Text als Textur und nicht als Schriftzeichen, und jede Bewegung rendert diese Textur Bild für Bild neu. Kleine Schrift, Text auf gekrümmten oder bewegten Flächen und Text in einer perspektivischen Ebene sind die schlimmsten Fälle.

Die Korrektur: Verlangen Sie den Text nicht mehr vom Videomodell. Erzeugen Sie das Einzelbild mit einem Bildmodell, in dem Sie günstig an der Typografie iterieren können, und animieren Sie dann dieses Bild. Zitieren Sie im Video-Prompt die exakte Zeichenfolge, halten Sie sie kurz und die beschriftete Fläche so flach und stabil wie möglich.

Vorher: „Eine Café-Fassade mit einem großen detaillierten Schild, Menütafeln und viel Beschilderung, während die Kamera vorbeischwenkt.“

Nachher: „Animiere das bereitgestellte Einzelbild. Das Schild mit der Aufschrift ‚DAYLIGHT‘ bleibt flach zur Kamera und unverändert. Langsames seitliches Driften nach rechts, das Schild bleibt die ganze Zeit vollständig im Bild, kein weiterer Text sichtbar.“

Auf OmniArt können Sie diesen ersten Schritt mit einem Bildmodell wie GPT Image 2 oder Seedream 5.0 Pro erledigen und das freigegebene Einzelbild dann im gleichen Workspace in ein Videomodell schicken. Bei allem, was zum Kunden geht, behandeln Sie lesbaren Text standardmäßig als Aufgabe für das Bildmodell.

Korrektur 6: Die Bewegung ist zu schnell, zittrig oder stockend

Was Sie sehen: Der Clip läuft wie in 1,5-facher Geschwindigkeit, oder das Motiv vibriert leicht, oder die Bewegung schreitet in sichtbaren Stufen voran statt flüssig.

Warum es passiert: Intensitätsadjektive werden als Geschwindigkeit gelesen. „Dynamisch“, „explosiv“, „energiegeladen“ und „actiongeladen“ drängen das Modell dazu, mehr Veränderung in dieselbe Anzahl von Bildern zu pressen. Die andere häufige Ursache ist, zu viel Ereignis in zu wenig Zeit zu verlangen — drei Momente in vier Sekunden lassen für keinen davon Bilder übrig.

Die Korrektur: Löschen Sie Intensitätswörter und geben Sie stattdessen das Tempo an. Ein Moment pro Clip, halten Sie fest, dass die Aufnahme durchgehend ist, und wenn die Aktion wirklich mehr Zeit braucht, verlangen Sie eine längere Dauer statt einer schnelleren Darbietung.

Vorher: „Explosive dynamische Actionaufnahme, Skateboarder macht Tricks, schnelle energiegeladene Bewegung, rasche Schnitte.“

Nachher: „Ein Skateboarder rollt eine Rampe hinauf und hebt oben in einen langsamen Ollie ab. Gleichmäßiges, ruhiges Tempo, eine durchgehende Aufnahme, keine Schnitte. Die Kamera fährt mit gleicher Geschwindigkeit daneben mit.“

Wenn das Ruckeln feinkörnig statt strukturell ist, probieren Sie eine höhere Stufe derselben Modellfamilie — eine Standardstufe statt einer Fast- oder Mini-Stufe —, denn niedrigere Stufen tauschen zeitliche Stabilität gegen Geschwindigkeit und Preis.

Korrektur 7: Ton und Lippensynchronität passen nicht zusammen

Was Sie sehen: Der Mund bewegt sich vor oder nach den Worten, der Dialog läuft weiter, während die Lippen geschlossen sind, oder die Sprache verschwindet unter Musik, die das Modell von sich aus hinzugefügt hat.

Warum es passiert: Lippensynchronität braucht einen sichtbaren Mund und einen Satz, der kurz genug für den Clip ist. Langer Dialog in einer Fünf-Sekunden-Aufnahme zwingt das Modell dazu, entweder den Mund zu hetzen oder die Synchronität aufzugeben. Atmosphärische Beschreibungen wie „mit epischem Soundtrack“ laden ein Musikbett ein, das mit der Stimme konkurriert.

Die Korrektur: Eine sprechende Person, ein kurzer Satz in Anführungszeichen, der Mund klar gerahmt und unverdeckt, und keine konkurrierenden Audioanweisungen. Sagen Sie genauso ausdrücklich, was still sein soll, wie das, was zu hören sein soll.

Vorher: „Zwei Personen sprechen über den Produktlaunch, mit epischem Soundtrack und Stadtatmosphäre, Nahaufnahme.“

Nachher: „Halbnahe Aufnahme einer Frau, die zur Kamera schaut, Mund vollständig sichtbar. Sie sagt: ‚Wir liefern am Freitag.‘ Dann hält sie inne und lächelt. Nur ruhiger Raumton, keine Musik.“

Veo 3.1 generiert nativen Ton einschließlich Dialog, und PixVerse V6 unterstützt Audio in der Free-Stufe von OmniArt. Wenn das gewünschte Modell keinen nativen Ton hat, ist der verlässliche Weg, den Clip stumm zu generieren und die Stimme separat mit einem Sprachmodell wie MiniMax Speech 2.8 oder ElevenLabs zu erzeugen und beides dann zusammenzuschneiden. Das gibt Ihnen zusätzlich neue Versuche beim Einsprechen, ohne das Bild neu zu generieren.

Schnellreferenz: von Symptom zu Korrektur

Nutzen Sie das als Triage-Tabelle, wenn ein Clip falsch zurückkommt. Ändern Sie den Punkt aus der ersten Spalte, bevor Sie irgendetwas anderes anfassen.

SymptomDas zuerst ändernHinweis zum Modell
Verzerrte Gesichter oder HändeWeitere Rahmung, kürzerer Clip, Startbild als BildVeo 3.1, Kling für menschliche Bewegung
Aktion ignoriertVerb nach vorn holen, eine konkrete AktionSeedance, PixVerse C1
Kamerabewegung fehltEine benannte, motivierte Bewegung; Konflikte entfernenKling, Seedance, Grok Imagine
Szene oder Identität driftetReferenzbild, nur beschreiben, was sich ändertPixVerse C1 mit Referenz, V6 für mehrere Aufnahmen
Entstellter TextDas Einzelbild zuerst in einem Bildmodell erzeugenGPT Image 2, Seedream 5.0 Pro, dann ein beliebiges Videomodell
Bewegung zu schnell oder zittrigIntensitätswörter löschen, Tempo angeben, längere DauerStandardstufen den Fast- oder Mini-Stufen vorziehen
Lippensynchronität schiefEin kurzer zitierter Satz, Mund im Bild, keine MusikVeo 3.1, PixVerse V6, oder Sprache separat ergänzen

Loslegen mit OmniArt

Nehmen Sie Ihren letzten misslungenen Clip und stellen Sie ihn gegen die sieben Symptome oben. Wenden Sie genau eine Korrektur an, generieren Sie neu und vergleichen Sie — zwei Durchgänge zeigen meist, ob das Problem der Prompt oder die Modellwahl war. Weil OmniArt Bild-, Video- und Audiomodelle in einem Workspace hält, kann eine hartnäckige Aufnahme zwischen Ansätzen wandern, ohne dass Sie Ihr Setup neu bauen: mit einem Bildmodell verankern, auf einem zweiten Videomodell erneut versuchen oder die Sprachspur separat ergänzen.

Öffnen Sie den Creation-Workspace, fügen Sie den korrigierten Prompt ein und behalten Sie die Versuche, die tragen.

Bereit zum Erstellen?

Starte mit KI die Erstellung beeindruckender Inhalte

Kostenlos starten