概述

Runtime MetaHuman Lip Sync 是一款插件,可为 MetaHuman 和自定义角色实现实时、离线及跨平台的口型同步。它允许您根据来自多种来源的音频输入来动画化角色的嘴唇,这些来源包括:
- 通过Runtime Audio Importer的可捕获声波进行麦克风输入
- 通过Runtime Text To Speech或Runtime AI Chatbot Integrator合成的语音
- 通过Runtime Audio Importer以多种格式流式传输或导入的音频数据
- 任何浮点PCM格式的音频数据(浮点样本数组)
该插件会根据音频输入在内部生成视位(音素的视觉表现)。由于它直接处理音频数据而非文本,该插件支持多语言输入,包括但不限于英语、西班牙语、法语、德语、日语、中文、韩语、俄语、意大利语、葡萄牙语、阿拉伯语和印地语。实际上支持任何语言,因为口型同步是基于音频音素生成的,而非依赖特定语言的文本处理。
标准模型生成14个视位,并使用预定义的姿态资源执行口型同步动画。相比之下,写实模型(专属于MetaHuman和基于ARKit的角色)生成81个面部控制变化,无需依赖预定义的姿态资源,从而产生更加逼真的面部动画。
角色兼容性
尽管名称如此,Runtime MetaHuman Lip Sync 也适用于远超 MetaHuman 范围的各类角色:
热门商业角色系统
- Daz Genesis 8/9 角色
- Reallusion Character Creator 3/4/5(CC3/CC4/CC5)角色
- Mixamo 角色
动画标准支持
- 基于FACS的混合变形系统
- Apple ARKit混合变形标准
- Preston Blair音素集
- 3ds Max音素系统
- 任何具有自定义面部表情变形目标(morph targets)的角色
许多主流系统,包括 Reallusion CC4/CC5 和 Daz Genesis 8.1/9,也可以转换为使用 ARKit 标准的 blendshape 名称。这让您可以为这些角色使用 Realistic Model,其面部动画质量更高,作为 Standard Model 手动 viseme 映射的替代方案。详见 将角色转换为 ARKit Blendshapes。
对于使用标准模型的非MetaHuman角色,请参阅自定义角色设置指南。对于使用逼真模型的基于ARKit的角色,请参阅形态目标集选择。
动画预览
看看这些短片动画,了解该插件在不同角色类型和模型上生成的唇形同步动画质量:
主要功能
- 麦克风输入的实时口型同步
- 支持离线音频处理
- 跨平台兼容性,支持特定模型的平台适配
- 支持多种角色系统和动画标准
- 灵活的口型映射,适用于自定义角色
- 通用语言支持——通过音频分析适用于任何口语
- 情绪感知的面部动画,增强表现力
- 可配置的输出类型(全脸或仅嘴部控制)
- 可选的眼部动画辅助,用于眨眼和视线追踪
口型同步模型
该插件提供多种口型同步模型,以满足不同项目的需求:
- 标准模型
- 逼真模型
- 情绪化的逼真模型
标准口型同步模型提供高效的跨平台性能,并具有广泛的角色兼容性:
- 适用于MetaHuman及所有自定义角色类型
- 针对实时性能优化
- 更低的资源需求
- 平台支持:Windows、Android、基于Android的平台(包括Meta Quest)
要使用标准模型,您需要安装额外的扩展插件。请参阅先决条件部分了解安装说明。
逼真的口型同步模型专为MetaHuman角色提供增强的视觉保真度:
- 兼容MetaHuman和基于ARKit的角色,具备高级面部动画(81个面部控制)
- 更高的视觉质量,嘴部动作更自然
- 性能要求略高
- 流式音频处理,适用于实时应用
- 非常适合电影级体验和近距离角色互动
- 三个优化级别:原始、半优化和高度优化
- 可配置的形态目标集(参见形态目标集选择)
- 平台支持:Windows、Mac、iOS、Linux、Android、基于Android的平台(包括Meta Quest)
真实模型包含在主插件中,无需任何额外扩展即可使用。
情绪感知的逼真模型为MetaHuman角色提供情感感知的面部动画:
- 兼容基于MetaHuman和ARKit的角色,支持情绪响应的面部动画(81个面部控制)
- 12种不同的情绪类型(中性、快乐、悲伤、自信等)
- 可配置的情绪强度(0.0至1.0)
- 可调节的预判时间以改善同步(20毫秒至200毫秒)
- 可选择的输出类型:全脸或仅嘴部控制
- 流式音频处理,适用于实时应用
- 可配置的形态目标集(参见形态目标集选择)
- 平台支持:Windows、Mac、iOS、Linux、Android、基于Android的平台(包括Meta Quest)
情绪驱动的写实模型包含在主插件中,无需任何额外扩展即可使用。
您可以根据项目的性能要求、角色兼容性、视觉质量、目标平台和功能需求,选择合适的模型。
工作原理
该插件按以下方式处理音频输入:
- 音频数据以浮点 PCM 格式接收,并带有指定的声道数和采样率
- 该插件处理音频以生成面部控制数据或视位,具体取决于模型
- 对于支持情绪启用的模型,情感上下文会被应用于面部动画
- 动画数据实时驱动角色的面部运动
性能架构
Runtime MetaHuman Lip Sync 使用纯 CPU 推理,以提供一致、低延迟的唇形同步结果,适用于实时应用。默认情况下,该插件每 10 毫秒 执行一次唇形同步处理(可调整——有关所有可用设置,包括 处理块大小、线程数 和其他性能参数,请参阅 插件配置)。
模型架构概述
唇形同步模型采用基于紧凑型Transformer的神经网络,通过梅尔频谱图分析处理音频。这种轻量级架构专为实时性能而设计,具备高效的CPU推理能力和极小的内存占用。
为什么选择CPU推理?
对于像实时口型同步这样的小规模、高频推理操作,CPU处理比GPU具有更好的延迟特性。在批大小为1、推理间隔为10-100毫秒的情况下,GPU因PCIe传输和内核启动产生的开销往往超过实际计算时间。此外,在游戏引擎中,GPU已被渲染、着色器和物理计算所饱和,造成资源争用,从而引入不可预测的延迟峰值。
硬件兼容性
该插件在大多数中端及更高配置的CPU上都能高效运行,无需专用图形硬件,即可在桌面、移动和VR平台上提供实时性能。对于硬件配置较弱的设备,您可以将模型类型调整为半优化或高度优化,或增大**处理块大小**,以在略微降低响应速度的情况下保持实时性能。
快速入门
以下是为角色启用口型同步的基本设置:
- 对于MetaHuman角色,请遵循设置指南
- 对于自定义角色,请遵循自定义角色设置指南
- 选择并配置您偏好的口型同步模型
- 在您的蓝图中设置音频输入处理
- 在动画蓝图中连接相应的口型同步节点
- 播放音频,观察您的角色同步动画效果
可选眼部动画
该插件还包含用于MetaHuman自动眨眼和视线追踪的可选辅助功能。这些功能与口型同步相互独立,既可以单独使用,也可以叠加在其之上。参见眼部动画辅助功能。
额外资源
📦 下载与链接
演示项目:
两个开箱即用的演示项目可供使用——详见专门的演示项目页面,其中包含完整详情、下载和操作指南:
- 完整AI对话NPC工作流 - 语音识别 + LLM聊天机器人 + TTS + 口型同步
- 基础口型同步演示 - 麦克风输入、音频文件、TTS
两个演示均支持跨平台(Windows、Mac、Linux、iOS、Android、Meta Quest),并以打包构建和完整的 UE 5.6+ 源码项目形式提供。
🎥 视频教程
精选演示:
写实模型(高质量)教程:
- 从音频文件/缓冲区实现高质量口型同步
- 带情绪控制与本地TTS的高质量口型同步
- 使用ElevenLabs与OpenAI TTS的高质量口型同步
- 高质量实时麦克风口型同步
- 适用于ARKit角色的高质量口型同步
标准模型教程:
通用设置:
💬 支持
- 定制开发: solutions@georgy.dev(为团队和组织提供的定制解决方案)