Pular para o conteúdo principal

Visão geral

Runtime MetaHuman Lip Sync Documentation

Runtime MetaHuman Lip Sync é um plugin que possibilita sincronização labial em tempo real, offline e multiplataforma para personagens MetaHuman e personalizados. Ele permite animar os lábios de um personagem em resposta à entrada de áudio de diversas fontes, incluindo:

O plugin gera internamente visemas (representações visuais de fonemas) com base na entrada de áudio. Como ele trabalha diretamente com dados de áudio em vez de texto, o plugin suporta entrada multilíngue, incluindo, mas não se limitando a inglês, espanhol, francês, alemão, japonês, chinês, coreano, russo, italiano, português, árabe e hindi. Literalmente qualquer idioma é suportado, pois o lip sync é gerado a partir dos fonemas do áudio, e não do processamento de texto específico do idioma.

O Standard Model produz 14 visemas e realiza animação de sincronização labial usando um asset de pose predefinido. Em contraste, os Realistic Models (exclusivos para personagens baseados em MetaHuman e ARKit) geram 81 alterações de controle facial sem depender de um asset de pose predefinido, resultando em animações faciais significativamente mais realistas.

Compatibilidade de Personagens

Apesar do nome, Runtime MetaHuman Lip Sync funciona com uma ampla variedade de personagens, não apenas MetaHumans:

  • Personagens Daz Genesis 8/9
  • Personagens Reallusion Character Creator 3/4/5 (CC3/CC4/CC5)
  • Personagens Mixamo

Suporte a Padrões de Animação

  • Sistemas de blendshapes baseados em FACS
  • Padrão de blendshapes do Apple ARKit
  • Conjuntos de fonemas de Preston Blair
  • Sistemas de fonemas do 3ds Max
  • Qualquer personagem com morph targets personalizados para expressões faciais

Muitos sistemas populares, incluindo Reallusion CC4/CC5 e Daz Genesis 8.1/9, também podem ser convertidos para usar nomes de blendshapes no padrão ARKit. Isso permite que você use o Modelo Realista para esses personagens, com sua animação facial de maior qualidade, como alternativa ao mapeamento manual de visemas do Modelo Padrão. Consulte Convertendo Personagens para Blendshapes ARKit para obter detalhes.

Para personagens que não são MetaHuman usando o Modelo Padrão, consulte o Guia de Configuração de Personagem Personalizado. Para personagens baseados em ARKit usando os Modelos Realistas, consulte Seleção de Conjunto de Morph Targets.

Pré-visualização de Animação

Confira estas animações curtas para ver a qualidade da animação de sincronização labial produzida pelo plugin em diferentes tipos de personagens e modelos:

Modelo realista com personagem MetaHuman
Modelo padrão com personagem MetaHuman
Modelo padrão com personagem personalizado
Modelo padrão com personagem personalizado

Recursos principais

Modelos de Lip Sync

O plugin oferece vários modelos de lip sync para atender a diferentes necessidades de projeto:

O modelo padrão de lip sync oferece desempenho eficiente e multiplataforma, com ampla compatibilidade de personagens:

  • Funciona com MetaHumans e todos os tipos de personagens personalizados
  • Otimizado para desempenho em tempo real
  • Menores requisitos de recursos
  • Suporte de plataforma: Windows, Android, plataformas baseadas em Android (incluindo Meta Quest)
Extensão de Plugin Necessária

Para usar o Modelo Padrão, você precisa instalar um plugin de extensão adicional. Consulte a seção de Pré-requisitos para instruções de instalação.

Você pode escolher o modelo apropriado com base nos requisitos do seu projeto, considerando desempenho, compatibilidade de personagens, qualidade visual, plataforma de destino e necessidades de recursos.

Como Funciona

O plugin processa a entrada de áudio da seguinte forma:

  1. Os dados de áudio são recebidos em formato PCM float com canais e taxa de amostragem especificados
  2. O plugin processa o áudio para gerar dados de controle facial ou visemas, dependendo do modelo
  3. Para modelos com suporte a emoções, o contexto emocional é aplicado à animação facial
  4. Os dados de animação controlam os movimentos faciais do personagem em tempo real

Arquitetura de Desempenho

O Runtime MetaHuman Lip Sync usa inferência apenas via CPU para entregar resultados de sincronização labial consistentes e de baixa latência, adequados para aplicações em tempo real. Por padrão, o plugin realiza o processamento de sincronização labial a cada 10 milissegundos (ajustável - consulte Configuração do Plugin para todas as configurações disponíveis, incluindo Tamanho do Chunk de Processamento, número de threads e outros parâmetros de desempenho).

Visão Geral da Arquitetura do Modelo

Os modelos de lip sync utilizam uma rede neural compacta baseada em transformer que processa áudio por meio de análise de mel-spectrograma. Essa arquitetura leve é especificamente projetada para desempenho em tempo real, com inferência eficiente em CPU e pegada mínima de memória.

Por que Inferência via CPU?

Para operações de inferência pequenas e frequentes, como sincronização labial em tempo real, o processamento via CPU oferece melhores características de latência do que a GPU. Com tamanho de lote 1 e intervalos de inferência de 10 a 100 ms, a sobrecarga da GPU proveniente de transferências PCIe e inicializações de kernel frequentemente excede o tempo real de computação. Além disso, em mecanismos de jogos, a GPU já está saturada com renderização, shaders e física, criando contenção de recursos que introduz picos de latência imprevisíveis.

Compatibilidade de Hardware

O plugin funciona de forma eficiente na maioria das CPUs de nível médio e superior, sem exigir hardware gráfico dedicado, proporcionando desempenho em tempo real em plataformas desktop, mobile e VR. Para hardwares mais fracos, você pode ajustar o Tipo de Modelo para Semi-Otimizado ou Altamente Otimizado, ou aumentar o Tamanho do Chunk de Processamento para manter o desempenho em tempo real com uma capacidade de resposta ligeiramente reduzida.

Início Rápido

Aqui está uma configuração básica para habilitar a sincronização labial no seu personagem:

  1. Para personagens MetaHuman, siga o Guia de Configuração
  2. Para personagens personalizados, siga o Guia de Configuração de Personagens Personalizados
  3. Escolha e configure seu modelo de lip sync preferido
  4. Configure o processamento de entrada de áudio no seu Blueprint
  5. Conecte o nó de lip sync apropriado no Animation Blueprint
  6. Reproduza o áudio e veja seu personagem animar em sincronia

Animação ocular opcional

O plugin também inclui auxiliares opcionais para piscar automático e rastreamento de olhar em MetaHumans. Eles são independentes da sincronização labial e podem ser usados de forma autônoma ou sobrepostos a ela. Consulte Auxiliares de Animação dos Olhos.

Recursos Adicionais

Projetos de Demonstração:

Dois projetos de demonstração prontos para uso estão disponíveis - consulte a página dedicada Projetos de Demonstração para obter detalhes completos, downloads e tutoriais passo a passo:

Ambas as demos são multiplataforma (Windows, Mac, Linux, iOS, Android, Meta Quest) e são fornecidas como builds empacotados e projetos-fonte completos em UE 5.6+.

🎥 Tutoriais em Vídeo

Demos em Destaque:

Tutoriais de Modelo Realista (Alta Qualidade):

Tutoriais do Modelo Padrão:

Configuração Geral:

💬 Suporte

  • Desenvolvimento Personalizado: solutions@georgy.dev (soluções personalizadas para equipes e organizações)
Join our Discord
online · support