Descripción general

Runtime MetaHuman Lip Sync es un plugin que permite sincronización de labios en tiempo real, sin conexión y multiplataforma tanto para MetaHuman como para personajes personalizados. Te permite animar los labios de un personaje en respuesta a entrada de audio de diversas fuentes, incluyendo:
- Entrada de micrófono mediante la onda de sonido capturable de Runtime Audio Importer
- Voz sintetizada de Runtime Text To Speech o Runtime AI Chatbot Integrator
- Datos de audio transmitidos o importados en múltiples formatos mediante Runtime Audio Importer
- Cualquier dato de audio en formato PCM flotante (una matriz de muestras de punto flotante)
El plugin genera internamente visemas (representaciones visuales de los fonemas) basándose en la entrada de audio. Dado que trabaja directamente con datos de audio en lugar de texto, el plugin admite entrada multilingüe, incluyendo, entre otros, inglés, español, francés, alemán, japonés, chino, coreano, ruso, italiano, portugués, árabe e hindi. Literalmente, cualquier idioma es compatible, ya que la sincronización de labios se genera a partir de los fonemas del audio y no del procesamiento de texto específico de un idioma.
El Modelo Estándar produce 14 visemas y realiza la animación de sincronización de labios utilizando un activo de pose predefinido. En contraste, los Modelos Realistas (exclusivos de personajes basados en MetaHuman y ARKit) generan 81 cambios de control facial sin depender de un activo de pose predefinido, lo que resulta en animaciones faciales significativamente más realistas.
Compatibilidad de personajes
A pesar de su nombre, Runtime MetaHuman Lip Sync funciona con una amplia variedad de personajes más allá de los MetaHumans:
Sistemas de personajes comerciales populares
- Personajes Daz Genesis 8/9
- Personajes de Reallusion Character Creator 3/4/5 (CC3/CC4/CC5)
- Personajes de Mixamo
Compatibilidad con estándares de animación
- Sistemas de blendshapes basados en FACS
- Estándar de blendshapes de Apple ARKit
- Conjuntos de fonemas de Preston Blair
- Sistemas de fonemas de 3ds Max
- Cualquier personaje con morph targets personalizados para expresiones faciales
Muchos sistemas populares, incluyendo Reallusion CC4/CC5 y Daz Genesis 8.1/9, también pueden convertirse para usar nombres de blendshapes estándar de ARKit. Esto te permite usar el Modelo Realista para estos personajes, con su animación facial de mayor calidad, como alternativa al mapeo manual de visemas del Modelo Estándar. Consulta Conversión de Personajes a Blendshapes de ARKit para más detalles.
Para personajes que no son MetaHuman que usan el Modelo Estándar, consulta la Guía de Configuración de Personajes Personalizados. Para personajes basados en ARKit que usan los Modelos Realistas, consulta la Selección de Objetivos de Morph.
Vista previa de la animación
Echa un vistazo a estas animaciones cortas para ver la calidad de la animación de sincronización de labios que produce el plugin en diferentes tipos de personajes y modelos:
Características principales
- Sincronización de labios en tiempo real desde entrada de micrófono
- Soporte para procesamiento de audio sin conexión
- Compatibilidad multiplataforma con soporte específico por plataforma según el modelo
- Soporte para múltiples sistemas de personajes y estándares de animación
- Mapeo flexible de visemas para personajes personalizados
- Soporte universal de idiomas: funciona con cualquier idioma hablado mediante análisis de audio
- Animación facial sensible al estado de ánimo para una mayor expresividad
- Tipos de salida configurables (controles de cara completa o solo de boca)
- Asistentes de animación ocular opcionales para parpadeos y seguimiento de la mirada
Modelos de sincronización de labios
El plugin ofrece múltiples modelos de lip sync para adaptarse a las diferentes necesidades del proyecto:
- Modelo estándar
- Modelo realista
- Modelo realista con estados de ánimo
El modelo estándar de sincronización de labios ofrece un rendimiento eficiente y multiplataforma con una amplia compatibilidad de personajes:
- Funciona con MetaHumans y todos los tipos de personajes personalizados
- Optimizado para rendimiento en tiempo real
- Menores requisitos de recursos
- Soporte de plataformas: Windows, Android, plataformas basadas en Android (incluido Meta Quest)
Para usar el Modelo Estándar, necesitas instalar un complemento de extensión adicional. Consulta la sección de Requisitos previos para las instrucciones de instalación.
El modelo de sincronización labial realista ofrece una fidelidad visual mejorada específicamente para personajes MetaHuman:
- Compatible con personajes basados en MetaHuman y ARKit con animación facial avanzada (81 controles faciales)
- Mayor calidad visual con movimientos de boca más naturales
- Requisitos de rendimiento ligeramente más altos
- Procesamiento de audio en streaming para aplicaciones en tiempo real
- Ideal para experiencias cinematográficas e interacciones cercanas con personajes
- Tres niveles de optimización: Original, Semioptimizado y Altamente optimizado
- Conjuntos de objetivos de morph configurables (consulta Selección del conjunto de objetivos de morph)
- Compatibilidad de plataformas: Windows, Mac, iOS, Linux, Android, plataformas basadas en Android (incluido Meta Quest)
El Modelo Realista está incluido en el plugin principal y no requiere extensiones adicionales para usarse.
El modelo realista con control de estado de ánimo proporciona animación facial consciente de las emociones para personajes MetaHuman:
- Compatible con personajes basados en MetaHuman y ARKit con animación facial reactiva al estado de ánimo (81 controles faciales)
- 12 tipos diferentes de estados de ánimo (Neutral, Feliz, Triste, Seguro, etc.)
- Intensidad de estado de ánimo configurable (0.0 a 1.0)
- Tiempo de anticipación ajustable para una mejor sincronización (20ms a 200ms)
- Tipos de salida seleccionables: controles de Cara Completa o Solo Boca
- Procesamiento de audio en streaming para aplicaciones en tiempo real
- Conjuntos de objetivos de morph configurables (consulta Selección de Conjunto de Objetivos de Morph)
- Compatibilidad de plataformas: Windows, Mac, iOS, Linux, Android, plataformas basadas en Android (incluido Meta Quest)
El Modelo Realista con Control de Estado de Ánimo está incluido en el plugin principal y no requiere extensiones adicionales para usarse.
Puedes elegir el modelo adecuado según los requisitos de tu proyecto en cuanto a rendimiento, compatibilidad de personajes, calidad visual, plataforma objetivo y necesidades de funciones.
Cómo funciona
El plugin procesa la entrada de audio de la siguiente manera:
- Los datos de audio se reciben en formato PCM de punto flotante con canales y frecuencia de muestreo especificados
- El plugin procesa el audio para generar datos de control facial o visemas según el modelo
- Para modelos con soporte de emociones, se aplica contexto emocional a la animación facial
- Los datos de animación impulsan los movimientos faciales del personaje en tiempo real
Arquitectura de rendimiento
Runtime MetaHuman Lip Sync utiliza inferencia solo con CPU para ofrecer resultados de sincronización de labios consistentes y de baja latencia, adecuados para aplicaciones en tiempo real. De forma predeterminada, el plugin realiza el procesamiento de sincronización de labios cada 10 milisegundos (ajustable; consulte Configuración del plugin para conocer todos los ajustes disponibles, incluidos el Tamaño del fragmento de procesamiento, el número de subprocesos y otros parámetros de rendimiento).
Descripción General de la Arquitectura del Modelo
Los modelos de lip sync utilizan una red neuronal compacta basada en transformadores que procesa el audio mediante análisis de mel-espectrograma. Esta arquitectura ligera está diseñada específicamente para un rendimiento en tiempo real con inferencia eficiente en CPU y una huella de memoria mínima.
¿Por qué inferencia por CPU?
Para operaciones de inferencia pequeñas y frecuentes, como la sincronización de labios en tiempo real, el procesamiento por CPU ofrece mejores características de latencia que la GPU. Con un tamaño de lote de 1 e intervalos de inferencia de 10 a 100 ms, la sobrecarga de la GPU debida a transferencias PCIe y lanzamientos de kernels a menudo supera el tiempo real de cómputo. Además, en los motores de juego, la GPU ya está saturada con renderizado, shaders y física, lo que crea contención de recursos que introduce picos de latencia impredecibles.
Compatibilidad de hardware
El plugin funciona de manera eficiente en la mayoría de las CPU de gama media y superior sin requerir hardware gráfico dedicado, ofreciendo rendimiento en tiempo real en plataformas de escritorio, móviles y VR. Para hardware más débil, puedes ajustar el Tipo de Modelo a Semi-Optimizado u Altamente Optimizado, o aumentar el Tamaño del Fragmento de Procesamiento para mantener el rendimiento en tiempo real con una capacidad de respuesta ligeramente reducida.
Inicio rápido
Aquí tienes una configuración básica para habilitar la sincronización de labios en tu personaje:
- Para personajes MetaHuman, sigue la Guía de configuración
- Para personajes personalizados, sigue la Guía de configuración de personajes personalizados
- Elige y configura tu modelo de sincronización de labios preferido
- Configura el procesamiento de entrada de audio en tu Blueprint
- Conecta el nodo de sincronización de labios adecuado en el Animation Blueprint
- Reproduce audio y observa cómo tu personaje se anima en sincronía
Animación ocular opcional
El plugin también incluye ayudantes opcionales para el parpadeo automático y el seguimiento de la mirada en MetaHumans. Estos son independientes de la sincronización de labios y pueden usarse de forma independiente o superpuestos sobre ella. Consulta Ayudantes de animación ocular.
Recursos adicionales
📦 Descargas y Enlaces
Proyectos de demostración:
Hay dos proyectos de demostración listos para usar disponibles; consulta la página dedicada de Proyectos de Demostración para obtener todos los detalles, descargas y tutoriales:
- Flujo de trabajo completo de NPC conversacional con IA - reconocimiento de voz + chatbot LLM + TTS + sincronización de labios
- Demo básica de sincronización de labios - entrada de micrófono, archivos de audio, TTS
Ambas demos son multiplataforma (Windows, Mac, Linux, iOS, Android, Meta Quest) y se distribuyen como compilaciones empaquetadas y proyectos fuente completos de UE 5.6+.
🎥 Tutoriales en Video
Demostraciones destacadas:
- Demostración de NPC Conversacional con IA
- Demostración básica de sincronización de labios (video anterior)
Tutoriales de Modelo Realista (Alta Calidad):
- Sincronización de labios de alta calidad desde archivo/búfer de audio
- Sincronización de labios de alta calidad con control de estado de ánimo y TTS local
- Sincronización de labios de alta calidad con ElevenLabs y TTS de OpenAI
- Sincronización de labios de alta calidad en vivo con micrófono
- Sincronización de labios de alta calidad para personajes ARKit
Tutoriales del Modelo Estándar:
- Sincronización de labios estándar con micrófono en vivo
- Sincronización de labios estándar con texto a voz local
- Sincronización de labios estándar con ElevenLabs y TTS de OpenAI
Configuración general:
- Añadir un personaje MetaHuman personalizado al proyecto de demostración
- Video tutorial de configuración
- Parpadeo de ojos y seguimiento de cámara de MetaHuman
- Combinación con animaciones faciales y corporales
💬 Soporte
- Desarrollo personalizado: solutions@georgy.dev (soluciones a medida para equipos y organizaciones)