Übersicht

Runtime MetaHuman Lip Sync ist ein Plugin, das Echtzeit-, Offline- und plattformübergreifendes Lip-Sync für sowohl MetaHuman- als auch benutzerdefinierte Charaktere ermöglicht. Es erlaubt Ihnen, die Lippen eines Charakters als Reaktion auf Audioeingaben aus verschiedenen Quellen zu animieren, darunter:
- Mikrofoneingabe über die erfassbare Schallwelle des Runtime Audio Importer
- Synthetisierte Sprache von Runtime Text To Speech oder Runtime AI Chatbot Integrator
- Gestreamte oder importierte Audiodaten in mehreren Formaten über den Runtime Audio Importer
- Beliebige Audiodaten im Float-PCM-Format (ein Array von Gleitkomma-Abtastwerten)
Das Plugin generiert intern Viseme (visuelle Darstellungen von Phonemen) basierend auf der Audioeingabe. Da es direkt mit Audiodaten statt mit Text arbeitet, unterstützt das Plugin mehrsprachige Eingaben, einschließlich, aber nicht beschränkt auf Englisch, Spanisch, Französisch, Deutsch, Japanisch, Chinesisch, Koreanisch, Russisch, Italienisch, Portugiesisch, Arabisch und Hindi. Praktisch jede Sprache wird unterstützt, da die Lippensynchronisation aus Audio-Phonemen und nicht aus sprachspezifischer Textverarbeitung generiert wird.
Das Standardmodell erzeugt 14 Viseme und führt die Lippen-Synchronisationsanimation mithilfe eines vordefinierten Pose-Assets durch. Im Gegensatz dazu erzeugen die Realistischen Modelle (exklusiv für MetaHuman- und ARKit-basierte Charaktere) 81 Gesichtssteuerungsänderungen, ohne auf ein vordefiniertes Pose-Asset zurückzugreifen, was zu deutlich realistischeren Gesichtsanimationen führt.
Charakter-Kompatibilität
Trotz seines Namens funktioniert Runtime MetaHuman Lip Sync mit einer breiten Palette von Charakteren, nicht nur mit MetaHumans:
Beliebte kommerzielle Charakter-Systeme
- Daz Genesis 8/9-Charaktere
- Reallusion Character Creator 3/4/5 (CC3/CC4/CC5)-Charaktere
- Mixamo-Charaktere
Unterstützung für Animationsstandards
- FACS-basierte Blendshape-Systeme
- Apple ARKit-Blendshape-Standard
- Preston-Blair-Phonemsätze
- 3ds-Max-Phonemsysteme
- Jeder Charakter mit benutzerdefinierten Morph-Zielen für Gesichtsausdrücke
Viele gängige Systeme, darunter Reallusion CC4/CC5 und Daz Genesis 8.1/9, können ebenfalls so konvertiert werden, dass sie ARKit-Standard-Blendshape-Namen verwenden. Dadurch können Sie das Realistische Modell für diese Charaktere nutzen, mit seiner höherwertigen Gesichtsanimation, als Alternative zur manuellen Visem-Zuordnung des Standardmodells. Weitere Details finden Sie unter Konvertieren von Charakteren zu ARKit-Blendshapes.
Für Nicht-MetaHuman-Charaktere mit dem Standardmodell siehe den Leitfaden zur Einrichtung benutzerdefinierter Charaktere. Für ARKit-basierte Charaktere mit den Realistischen Modellen siehe Auswahl der Morph-Ziel-Sets.
Animationsvorschau
Schauen Sie sich diese kurzen Animationen an, um die Qualität der Lippen-Synchronisations-Animation zu sehen, die das Plugin bei verschiedenen Charaktertypen und Modellen erzeugt:
Hauptfunktionen
- Echtzeit-Lippensynchronisation über Mikrofoneingabe
- Unterstützung für die Offline-Audioverarbeitung
- Plattformübergreifende Kompatibilität mit modellspezifischer Plattformunterstützung
- Unterstützung für mehrere Charaktersysteme und Animationsstandards
- Flexibles Visem-Mapping für benutzerdefinierte Charaktere
- Universelle Sprachunterstützung – funktioniert mit jeder gesprochenen Sprache durch Audioanalyse
- Stimmungsbewusste Gesichtsanimation für verbesserte Ausdruckskraft
- Konfigurierbare Ausgabetypen (Steuerung des gesamten Gesichts oder nur des Mundes)
- Optionale Augenanimations-Hilfsfunktionen für Blinzeln und Blickverfolgung
Lip-Sync-Modelle
Das Plugin bietet mehrere Lip-Sync-Modelle, um unterschiedlichen Projektanforderungen gerecht zu werden:
- Standardmodell
- Realistisches Modell
- Stimmungsfähiges realistisches Modell
Das Standard-Lip-Sync-Modell bietet effiziente, plattformübergreifende Leistung mit breiter Charakterkompatibilität:
- Funktioniert mit MetaHumans und allen benutzerdefinierten Charaktertypen
- Optimiert für Echtzeit-Leistung
- Geringere Ressourcenanforderungen
- Plattformunterstützung: Windows, Android, Android-basierte Plattformen (einschließlich Meta Quest)
Um das Standardmodell zu verwenden, müssen Sie ein zusätzliches Erweiterungs-Plugin installieren. Siehe den Abschnitt „Voraussetzungen“ für Installationsanweisungen.
Das realistische Lippen-Synchronisationsmodell liefert eine verbesserte visuelle Wiedergabetreue, die speziell für MetaHuman-Charaktere entwickelt wurde:
- Kompatibel mit MetaHuman- und ARKit-basierten Charakteren mit erweiterter Gesichtsanimation (81 Gesichtssteuerungen)
- Höhere visuelle Qualität mit natürlicheren Mundbewegungen
- Etwas höhere Leistungsanforderungen
- Streaming-Audioverarbeitung für Echtzeitanwendungen
- Ideal für filmische Erlebnisse und Nahaufnahmen von Charakterinteraktionen
- Drei Optimierungsstufen: Original, Semi-optimiert und Hochoptimiert
- Konfigurierbare Morph-Ziel-Sets (siehe Auswahl des Morph-Ziel-Sets)
- Plattformunterstützung: Windows, Mac, iOS, Linux, Android, Android-basierte Plattformen (einschließlich Meta Quest)
Der Realistic Model ist im Haupt-Plugin enthalten und erfordert keine zusätzlichen Erweiterungen zur Nutzung.
Der stimmungsfähige realistische Modell bietet emotionsbewusste Gesichtsanimationen für MetaHuman-Charaktere:
- Kompatibel mit MetaHuman- und ARKit-basierten Charakteren mit stimmungsabhängiger Gesichtsanimation (81 Gesichtssteuerungen)
- 12 verschiedene Stimmungstypen (Neutral, Fröhlich, Traurig, Selbstbewusst usw.)
- Konfigurierbare Stimmungsintensität (0,0 bis 1,0)
- Einstellbares Vorausschau-Timing für verbesserte Synchronisation (20 ms bis 200 ms)
- Wählbare Ausgabetypen: Volles Gesicht oder nur Mundsteuerungen
- Streaming-Audioverarbeitung für Echtzeitanwendungen
- Konfigurierbare Morph-Ziel-Sets (siehe Auswahl des Morph-Ziel-Sets)
- Plattformunterstützung: Windows, Mac, iOS, Linux, Android, Android-basierte Plattformen (einschließlich Meta Quest)
Der stimmungsfähige realistische Model ist im Haupt-Plugin enthalten und erfordert keine zusätzlichen Erweiterungen zur Nutzung.
Sie können das passende Modell basierend auf den Anforderungen Ihres Projekts auswählen – hinsichtlich Leistung, Charakterkompatibilität, visueller Qualität, Zielplattform und Funktionsbedarf.
So funktioniert es
Das Plugin verarbeitet Audioeingaben auf folgende Weise:
- Audiodaten werden als Float-PCM-Format mit angegebenen Kanälen und Abtastrate empfangen
- Das Plugin verarbeitet die Audiodaten, um je nach Modell Gesichtssteuerungsdaten oder Viseme zu generieren
- Bei stimmungsfähigen Modellen wird emotionaler Kontext auf die Gesichtsanimation angewendet
- Die Animationsdaten steuern die Gesichtsbewegungen des Charakters in Echtzeit
Leistungsarchitektur
Runtime MetaHuman Lip Sync verwendet reine CPU-Inferenz, um konsistente Lip-Sync-Ergebnisse mit geringer Latenz zu liefern, die für Echtzeitanwendungen geeignet sind. Standardmäßig führt das Plugin die Lip-Sync-Verarbeitung alle 10 Millisekunden durch (anpassbar – siehe Plugin-Konfiguration für alle verfügbaren Einstellungen, einschließlich Verarbeitungs-Chunk-Größe, Thread-Anzahl und anderer Leistungsparameter).
Modellarchitektur-Übersicht
Die Lippen-Synchronisationsmodelle verwenden ein kompaktes, auf Transformatoren basierendes neuronales Netzwerk, das Audio durch Mel-Spektrogramm-Analyse verarbeitet. Diese leichtgewichtige Architektur ist speziell für Echtzeitleistung mit effizienter CPU-Inferenz und minimalem Speicherbedarf ausgelegt.
Warum CPU-Inferenz?
Bei kleinen, häufigen Inferenzoperationen wie Echtzeit-Lip-Sync bietet die CPU-Verarbeitung bessere Latenzeigenschaften als die GPU. Bei einer Batchgröße von 1 mit Inferenzintervallen von 10–100 ms übersteigt der GPU-Overhead durch PCIe-Transfers und Kernel-Starts oft die tatsächliche Rechenzeit. Darüber hinaus ist die GPU in Spiel-Engines bereits durch Rendering, Shader und Physik ausgelastet, was zu Ressourcenkonflikten führt, die unvorhersehbare Latenzspitzen verursachen.
Hardware-Kompatibilität
Das Plugin arbeitet effizient auf den meisten Mittelklasse- und höheren CPUs, ohne dass eine dedizierte Grafikhardware erforderlich ist, und bietet Echtzeitleistung auf Desktop-, Mobil- und VR-Plattformen. Für schwächere Hardware können Sie den Modelltyp auf Semi-Optimiert oder Hochoptimiert einstellen oder die Verarbeitungschunkgröße erhöhen, um die Echtzeitleistung bei leicht reduzierter Reaktionsfähigkeit beizubehalten.
Schnellstart
Hier ist ein grundlegendes Setup, um Lip Sync für deinen Charakter zu aktivieren:
- Für MetaHuman-Charaktere folgen Sie dem Einrichtungsleitfaden
- Für benutzerdefinierte Charaktere folgen Sie dem Leitfaden zur Einrichtung benutzerdefinierter Charaktere
- Wählen und konfigurieren Sie Ihr bevorzugtes Lip-Sync-Modell
- Richten Sie die Audioeingabeverarbeitung in Ihrem Blueprint ein
- Verbinden Sie den entsprechenden Lip-Sync-Knoten im Animation Blueprint
- Spielen Sie Audio ab und sehen Sie, wie sich Ihr Charakter synchron animiert
Optionale Augenanimation
Das Plugin enthält außerdem optionale Helfer für automatisches Blinzeln und Blickverfolgung bei MetaHumans. Diese sind unabhängig von der Lippen-Synchronisation und können eigenständig oder zusätzlich dazu verwendet werden. Siehe Helfer für Augenanimation.
Zusätzliche Ressourcen
📦 Downloads & Links
Demoprojekte:
Zwei einsatzbereite Demo-Projekte sind verfügbar – siehe die spezielle Seite Demo-Projekte für vollständige Details, Downloads und Schritt-für-Schritt-Anleitungen:
- Vollständiger KI-Konversations-NPC-Workflow - Spracherkennung + LLM-Chatbot + TTS + Lippen-Synchronisation
- Grundlegendes Lippen-Synchronisations-Demo - Mikrofoneingabe, Audiodateien, TTS
Beide Demos sind plattformübergreifend (Windows, Mac, Linux, iOS, Android, Meta Quest) und werden als gepackte Builds sowie als vollständige UE 5.6+-Quellprojekte ausgeliefert.
🎥 Video-Tutorials
Ausgewählte Demos:
Realistisches Modell (Hochwertig) Tutorials:
- Hochwertige Lippen-Synchronisation aus Audiodatei/Puffer
- Hochwertige Lippen-Synchronisation mit Stimmungssteuerung & lokaler TTS
- Hochwertige Lippen-Synchronisation mit ElevenLabs & OpenAI TTS
- Hochwertige Live-Mikrofon-Lippen-Synchronisation
- Hochwertige Lippen-Synchronisation für ARKit-Charaktere
Standardmodell-Tutorials:
- Standard-Live-Mikrofon-Lippensynchronisation
- Standard-Lippensynchronisation mit lokaler Text-zu-Sprache
- Standard-Lippensynchronisation mit ElevenLabs & OpenAI TTS
Allgemeine Einrichtung:
- Hinzufügen eines benutzerdefinierten MetaHuman-Charakters zum Demo-Projekt
- Video-Tutorial zur Einrichtung
- MetaHuman-Augenblinzeln & Kameraverfolgung
- Kombination mit Gesichts- und Körperanimationen
💬 Support
- Individuelle Entwicklung: solutions@georgy.dev (maßgeschneiderte Lösungen für Teams & Organisationen)