Visão geral

Runtime MetaHuman Lip Sync é um plugin que possibilita sincronização labial em tempo real, offline e multiplataforma para personagens MetaHuman e personalizados. Ele permite animar os lábios de um personagem em resposta à entrada de áudio de diversas fontes, incluindo:
- Entrada de microfone via onda sonora capturável do Runtime Audio Importer
- Fala sintetizada do Runtime Text To Speech ou do Runtime AI Chatbot Integrator
- Dados de áudio transmitidos ou importados em vários formatos via Runtime Audio Importer
- Quaisquer dados de áudio em formato PCM float (uma matriz de amostras de ponto flutuante)
O plugin gera internamente visemas (representações visuais de fonemas) com base na entrada de áudio. Como ele trabalha diretamente com dados de áudio em vez de texto, o plugin suporta entrada multilíngue, incluindo, mas não se limitando a inglês, espanhol, francês, alemão, japonês, chinês, coreano, russo, italiano, português, árabe e hindi. Literalmente qualquer idioma é suportado, pois o lip sync é gerado a partir dos fonemas do áudio, e não do processamento de texto específico do idioma.
O Standard Model produz 14 visemas e realiza animação de sincronização labial usando um asset de pose predefinido. Em contraste, os Realistic Models (exclusivos para personagens baseados em MetaHuman e ARKit) geram 81 alterações de controle facial sem depender de um asset de pose predefinido, resultando em animações faciais significativamente mais realistas.
Compatibilidade de Personagens
Apesar do nome, Runtime MetaHuman Lip Sync funciona com uma ampla variedade de personagens, não apenas MetaHumans:
Sistemas Comerciais Populares de Personagens
- Personagens Daz Genesis 8/9
- Personagens Reallusion Character Creator 3/4/5 (CC3/CC4/CC5)
- Personagens Mixamo
Suporte a Padrões de Animação
- Sistemas de blendshapes baseados em FACS
- Padrão de blendshapes do Apple ARKit
- Conjuntos de fonemas de Preston Blair
- Sistemas de fonemas do 3ds Max
- Qualquer personagem com morph targets personalizados para expressões faciais
Muitos sistemas populares, incluindo Reallusion CC4/CC5 e Daz Genesis 8.1/9, também podem ser convertidos para usar nomes de blendshapes no padrão ARKit. Isso permite que você use o Modelo Realista para esses personagens, com sua animação facial de maior qualidade, como alternativa ao mapeamento manual de visemas do Modelo Padrão. Consulte Convertendo Personagens para Blendshapes ARKit para obter detalhes.
Para personagens que não são MetaHuman usando o Modelo Padrão, consulte o Guia de Configuração de Personagem Personalizado. Para personagens baseados em ARKit usando os Modelos Realistas, consulte Seleção de Conjunto de Morph Targets.
Pré-visualização de Animação
Confira estas animações curtas para ver a qualidade da animação de sincronização labial produzida pelo plugin em diferentes tipos de personagens e modelos:
Recursos principais
- Sincronização labial em tempo real a partir de entrada de microfone
- Suporte para processamento de áudio offline
- Compatibilidade multiplataforma com suporte específico por modelo de plataforma
- Suporte para múltiplos sistemas de personagens e padrões de animação
- Mapeamento flexível de visemas para personagens personalizados
- Suporte universal a idiomas — funciona com qualquer idioma falado por meio de análise de áudio
- Animação facial sensível ao humor para maior expressividade
- Tipos de saída configuráveis (controles de rosto completo ou apenas boca)
- Auxiliares de animação dos olhos opcionais para piscadas e rastreamento do olhar
Modelos de Lip Sync
O plugin oferece vários modelos de lip sync para atender a diferentes necessidades de projeto:
- Modelo Padrão
- Modelo Realista
- Modelo Realista com Suporte a Humor
O modelo padrão de lip sync oferece desempenho eficiente e multiplataforma, com ampla compatibilidade de personagens:
- Funciona com MetaHumans e todos os tipos de personagens personalizados
- Otimizado para desempenho em tempo real
- Menores requisitos de recursos
- Suporte de plataforma: Windows, Android, plataformas baseadas em Android (incluindo Meta Quest)
Para usar o Modelo Padrão, você precisa instalar um plugin de extensão adicional. Consulte a seção de Pré-requisitos para instruções de instalação.
O modelo realista de sincronização labial oferece fidelidade visual aprimorada, especificamente para personagens MetaHuman:
- Compatível com personagens baseados em MetaHuman e ARKit com animação facial avançada (81 controles faciais)
- Maior qualidade visual com movimentos bucais mais naturais
- Requisitos de desempenho ligeiramente mais altos
- Processamento de áudio em streaming para aplicações em tempo real
- Ideal para experiências cinematográficas e interações próximas com personagens
- Três níveis de otimização: Original, Semiotimizado e Altamente Otimizado
- Conjuntos de morph targets configuráveis (consulte Seleção de Conjunto de Morph Targets)
- Suporte a plataformas: Windows, Mac, iOS, Linux, Android, plataformas baseadas em Android (incluindo Meta Quest)
O Modelo Realista está incluído no plugin principal e não requer extensões adicionais para uso.
O modelo realista habilitado para humor fornece animação facial consciente das emoções para personagens MetaHuman:
- Compatível com personagens baseados em MetaHuman e ARKit, com animação facial responsiva ao humor (81 controles faciais)
- 12 tipos diferentes de humor (Neutro, Feliz, Triste, Confiante, etc.)
- Intensidade de humor configurável (0,0 a 1,0)
- Tempo de antecipação ajustável para melhor sincronização (20ms a 200ms)
- Tipos de saída selecionáveis: controles de Rosto Completo ou Somente Boca
- Processamento de áudio em streaming para aplicações em tempo real
- Conjuntos de alvos de morph configuráveis (consulte Seleção de Conjunto de Alvos de Morph)
- Suporte a plataformas: Windows, Mac, iOS, Linux, Android, plataformas baseadas em Android (incluindo Meta Quest)
O Modelo Realista com Suporte a Humor está incluído no plugin principal e não requer extensões adicionais para uso.
Você pode escolher o modelo apropriado com base nos requisitos do seu projeto, considerando desempenho, compatibilidade de personagens, qualidade visual, plataforma de destino e necessidades de recursos.
Como Funciona
O plugin processa a entrada de áudio da seguinte forma:
- Os dados de áudio são recebidos em formato PCM float com canais e taxa de amostragem especificados
- O plugin processa o áudio para gerar dados de controle facial ou visemas, dependendo do modelo
- Para modelos com suporte a emoções, o contexto emocional é aplicado à animação facial
- Os dados de animação controlam os movimentos faciais do personagem em tempo real
Arquitetura de Desempenho
O Runtime MetaHuman Lip Sync usa inferência apenas via CPU para entregar resultados de sincronização labial consistentes e de baixa latência, adequados para aplicações em tempo real. Por padrão, o plugin realiza o processamento de sincronização labial a cada 10 milissegundos (ajustável - consulte Configuração do Plugin para todas as configurações disponíveis, incluindo Tamanho do Chunk de Processamento, número de threads e outros parâmetros de desempenho).
Visão Geral da Arquitetura do Modelo
Os modelos de lip sync utilizam uma rede neural compacta baseada em transformer que processa áudio por meio de análise de mel-spectrograma. Essa arquitetura leve é especificamente projetada para desempenho em tempo real, com inferência eficiente em CPU e pegada mínima de memória.
Por que Inferência via CPU?
Para operações de inferência pequenas e frequentes, como sincronização labial em tempo real, o processamento via CPU oferece melhores características de latência do que a GPU. Com tamanho de lote 1 e intervalos de inferência de 10 a 100 ms, a sobrecarga da GPU proveniente de transferências PCIe e inicializações de kernel frequentemente excede o tempo real de computação. Além disso, em mecanismos de jogos, a GPU já está saturada com renderização, shaders e física, criando contenção de recursos que introduz picos de latência imprevisíveis.
Compatibilidade de Hardware
O plugin funciona de forma eficiente na maioria das CPUs de nível médio e superior, sem exigir hardware gráfico dedicado, proporcionando desempenho em tempo real em plataformas desktop, mobile e VR. Para hardwares mais fracos, você pode ajustar o Tipo de Modelo para Semi-Otimizado ou Altamente Otimizado, ou aumentar o Tamanho do Chunk de Processamento para manter o desempenho em tempo real com uma capacidade de resposta ligeiramente reduzida.
Início Rápido
Aqui está uma configuração básica para habilitar a sincronização labial no seu personagem:
- Para personagens MetaHuman, siga o Guia de Configuração
- Para personagens personalizados, siga o Guia de Configuração de Personagens Personalizados
- Escolha e configure seu modelo de lip sync preferido
- Configure o processamento de entrada de áudio no seu Blueprint
- Conecte o nó de lip sync apropriado no Animation Blueprint
- Reproduza o áudio e veja seu personagem animar em sincronia
Animação ocular opcional
O plugin também inclui auxiliares opcionais para piscar automático e rastreamento de olhar em MetaHumans. Eles são independentes da sincronização labial e podem ser usados de forma autônoma ou sobrepostos a ela. Consulte Auxiliares de Animação dos Olhos.
Recursos Adicionais
📦 Downloads e Links
Projetos de Demonstração:
Dois projetos de demonstração prontos para uso estão disponíveis - consulte a página dedicada Projetos de Demonstração para obter detalhes completos, downloads e tutoriais passo a passo:
- Fluxo de Trabalho Completo de NPC Conversacional com IA - reconhecimento de fala + chatbot LLM + TTS + sincronização labial
- Demonstração Básica de Sincronização Labial - entrada de microfone, arquivos de áudio, TTS
Ambas as demos são multiplataforma (Windows, Mac, Linux, iOS, Android, Meta Quest) e são fornecidas como builds empacotados e projetos-fonte completos em UE 5.6+.
🎥 Tutoriais em Vídeo
Demos em Destaque:
Tutoriais de Modelo Realista (Alta Qualidade):
- Sincronização Labial de Alta Qualidade a partir de Arquivo/Buffer de Áudio
- Sincronização Labial de Alta Qualidade com Controle de Humor e TTS Local
- Sincronização Labial de Alta Qualidade com ElevenLabs e TTS da OpenAI
- Sincronização Labial de Alta Qualidade ao Vivo com Microfone
- Sincronização Labial de Alta Qualidade para Personagens ARKit
Tutoriais do Modelo Padrão:
- Sincronização Labial Padrão com Microfone ao Vivo
- Sincronização Labial Padrão com Texto-para-Fala Local
- Sincronização Labial Padrão com ElevenLabs e TTS da OpenAI
Configuração Geral:
- Adicionando um Personagem MetaHuman Personalizado ao Projeto de Demonstração
- Vídeo tutorial de configuração
- Piscar de Olhos do MetaHuman e Rastreamento de Câmera
- Combinando com Animações Faciais e Corporais
💬 Suporte
- Desenvolvimento Personalizado: solutions@georgy.dev (soluções personalizadas para equipes e organizações)