TutorialTutorials und Anleitungen4 Min. Lesezeit

Leitfaden für sprechenden KI-Avatar und Lippensynchronisation

Bau ein einwilligendes Sprechporträt für einen Bibliotheksgruß in einem Satz: Gesicht festlegen, Stimme aufnehmen, das Mundtiming außerhalb von OmniArt testen und den Ausschnitt prüfen, den du veröffentlichst.

OmniArt-Team

Ein sprechender Avatar ist ein Porträt, das zu sprechen scheint. Die nützliche Aufgabe ist eng: ein Bibliotheksgruß, ein Produktnebenbei oder ein Lektionsintro von einem oder zwei Sätzen. Dieser Leitfaden nutzt eine fiktive Bibliotheksassistentin, Mara Chen, als Planungsbeispiel. Ihre Zeile lautet: „Deine Vorbestellung liegt an der Theke bereit.“

Auf OmniArt kannst du das Porträt im Bild-Workspace entwerfen und die Stimme mit einem Sprachmodell im Audio-Workspace generieren. Der öffentliche Modellkatalog enthält Bildmodelle, Videomodelle und Sprachmodelle. Er listet keine eigene Steuerung für Lippensynchronisation oder sprechende Avatare, die ein Skript auf Mundformen abbildet. Schließ diese Abstimmung in einem externen Lippensynchronisations-Editor ab und prüfe die Datei im Ausschnitt, den du veröffentlichst. Hintergrund zur Kategorie steht in den Avatar-Notizen, den Notizen zur Lippensynchronisation und den Notizen zum Foto-Avatar.

Wofür ein Sprechporträt da ist

Nutze ein Sprechporträt, wenn das Gesicht die Botschaft trägt und die Einstellung nah bleibt. Maras Zeile funktioniert, weil die Zuschauenden eine Tatsache und einen Ort zum Hinschauen brauchen: die Theke, nicht eine Führung durch das Gebäude. Plane einen Gedanken, ein Gesicht und einen Bildausschnitt. Eine Regaleinstellung gehört in einen eigenen Clip.

Hol die Einwilligung ein, bevor du ein Gesicht animierst

Animiere ein Gesicht, das du geschaffen hast, oder eine reale Person, die genau dieser Nutzung zugestimmt hat. Wenn Mara auf einer Kollegin beruht, hol ein schriftliches Ja für das Porträt, die Stimme und die Orte ein, an denen du den Clip postest.

Warnung

Lass private Personen, Persönlichkeiten des öffentlichen Lebens und Kundenstimmen aus, die du nicht nachahmen darfst. Wenn das Ergebnis eine realistische synthetische Person ist, setze den Hinweis, den die Zielplattform verlangt, in die Bildunterschrift oder auf das Bild.

Schreib das Skript und wähle die Stimme

Schreib für einen Atemzug. „Deine Vorbestellung liegt an der Theke bereit.“ sitzt sauber. Lies die Zeile laut. Wenn du stolperst, kürze Wörter, bevor du generierst.

Generiere die Stimme im Audio-Workspace von OmniArt und behalte eine Voreinstellung für das ganze Stück. Der Leitfaden zu MiniMax Speech 2.8 behandelt HD- und Turbo-Aufnahmen und die Zeichensetzung. Behalte eine Voreinstellung von der Testzeile bis zur finalen Zeile, einschließlich der kurzen Pause an jedem Ende.

Mach einen Sync-Test an einer kurzen Zeile

Bevor irgendein externes Werkzeug kommt, mach einen kurzen Bild-zu-Video-Test von Mara mit einem kleinen Nicken oder einem Blinzeln. Dieser Test prüft Licht, Schultern und ob das Gesicht Mara bleibt. Er behauptet nicht, dass der Mund zu den Wörtern passt. Ein Videomodell, das ein Bild annimmt, kann das Standbild bewegen. Diese Bewegung ist keine Steuerung, die Einzelbilder an deine Stimmaufnahme bindet.

Nimm die freigegebene Stimme in einen Lippensynchronisations-Editor außerhalb von OmniArt und synchronisiere nur diesen einen Satz. Spiel ihn in normaler Geschwindigkeit mit Ton ab. Der Mund sollte sich mit dem ersten Wort öffnen und zur Ruhe kommen, wenn die Phrase endet, und der Kiefer bleibt am Gesicht.

Wenn der Test scheitert, änderst du eine Eingabe. Nimm ein klareres frontales Standbild, eine langsamere Lesung oder eine sauberere Audiodatei. Lehne zum Beispiel ein Dreiviertel-Selfie mit eingezogenem Kinn ab, wenn es die Unterlippe verdeckt: ein Sync-Werkzeug müsste den fehlenden Mundrand erfinden. Das ist ein Ablehnungskriterium, kein Ergebnis aus einem Test, den wir durchgeführt haben.

Halt das Gesicht über die Aufnahmen hinweg still

Mara braucht dieselben Augen, denselben Scheitel und denselben offenen Kragen im Standbild, im Bewegungstest und im synchronisierten Export. Verwende das freigegebene Bild erneut. Der Charakter-Leitfaden gilt hier, auch wenn die Performance ein Satz ist.

Das freigegebene Standbild ist auf Augenhöhe, mit dem Bibliotheksfenster hinter ihrer linken Schulter und nichts über dem Mund. Sonnenbrille, eine Hand am Kinn, starke Unschärfe und ein steiles Profil verdecken die Formen, die ein Lippensynchronisations-Editor lesen muss.

Prüf den Clip in seinem finalen Ausschnitt

Prüfe die exportierte Datei in dem Ausschnitt, den du veröffentlichst. Für einen Bibliothekspost in 9:16 setzt du Untertitel unter das Kinn, damit sie den Mund nicht kreuzen. Prüf, dass die Augen nach dem Beschnitt noch die Linse treffen, dass die Stimme kein Raumrauschen hat und dass die Wörter im Bild zur gesprochenen Zeile passen.

Sieh einmal auf die Bedeutung und einmal auf den Mund. Ein Bild, das in der Pause scharf wirkt, kann sich beim Satzanfang trotzdem spät anfühlen. Halt jede Musik unter der Stimme. Wenn der Beschnitt den Kragen anschneidet, geh zum freigegebenen Standbild zurück.

Erste Schritte auf OmniArt

Erstelle Mara als originales frontales Porträt im Bild-Workspace, mit beiden Augen und dem Mund frei. Generiere die Stimme für den einen Satz im Audio-Workspace und speichere diese Aufnahme. Nutze ein Videomodell nur für einen kurzen Bewegungstest des Standbilds. Schließ die Lippensynchronisation in einem externen Editor ab und sieh dir dann den finalen Ausschnitt mit gesetzten Untertiteln an, bevor du veröffentlichst.

Bereit zum Erstellen?

Starte mit KI die Erstellung beeindruckender Inhalte

Kostenlos starten