總覽

Runtime MetaHuman Lip Sync 是一款外掛程式,可為 MetaHuman 與自訂角色提供即時、離線且跨平台的嘴型同步功能。它可讓您根據來自各種來源的音訊輸入來驅動角色嘴唇的動畫,這些來源包括:
- 透過 Runtime Audio Importer 的可捕捉聲波進行麥克風輸入
- 來自 Runtime Text To Speech 或 Runtime AI Chatbot Integrator 的合成語音
- 透過 Runtime Audio Importer 以多種格式串流或匯入的音訊資料
- 任何採用浮點 PCM 格式(浮點樣本陣列)的音訊資料
此外掛程式會根據音訊輸入,在內部生成 visemes(音素的視覺表現)。由於它直接處理音訊資料而非文字,此外掛程式支援多語言輸入,包括但不限於英文、西班牙文、法文、德文、日文、中文、韓文、俄文、義大利文、葡萄牙文、阿拉伯文和印度文。基本上任何語言都受支援,因為嘴型同步是從音訊音素生成的,而非依賴特定語言的文字處理。
標準模型會產生14 個 visemes,並使用預先定義的姿勢資產來執行口型同步動畫。相較之下,擬真模型(僅限於MetaHuman 和基於 ARKit 的角色)會產生 81 種臉部控制變化,且不依賴預先定義的姿勢資產,因此能呈現出更為逼真的臉部動畫。
角色相容性
儘管名稱如此,Runtime MetaHuman Lip Sync 可與 MetaHuman 以外的多種角色搭配使用:
熱門商業角色系統
- Daz Genesis 8/9 角色
- Reallusion Character Creator 3/4/5(CC3/CC4/CC5)角色
- Mixamo 角色
動畫標準支援
- 基於 FACS 的 blendshape 系統
- Apple ARKit blendshape 標準
- Preston Blair 音素集
- 3ds Max 音素系統
- 任何具有自訂 morph target 以用於面部表情的角色
許多熱門系統,包括 Reallusion CC4/CC5 和 Daz Genesis 8.1/9,也可以轉換為使用 ARKit 標準的 blendshape 名稱。這讓您能為這些角色使用 Realistic Model,以其更高品質的面部動畫,作為 Standard Model 手動 viseme 對應的替代方案。詳情請參閱 將角色轉換為 ARKit Blendshapes。
針對使用標準模型的非 MetaHuman 角色,請參閱自訂角色設定指南。針對使用寫實模型的 ARKit 角色,請參閱形變目標集選擇。
動畫預覽
看看這些短片,了解外掛在不同角色類型和模型上產生的嘴型同步動畫品質:
主要功能
- 麥克風輸入的即時口型同步
- 支援離線音訊處理
- 跨平台相容性,並提供特定模型的平台支援
- 支援多種角色系統與動畫標準
- 彈性的視位映射,適用於自訂角色
- 通用語言支援——透過音訊分析適用於任何口說語言
- 情緒感知的臉部動畫,增強表現力
- 可設定的輸出類型(全臉或僅嘴部控制)
- 可選的眼睛動畫輔助功能,用於眨眼與視線追蹤
唇形同步模型
此插件提供多種口型同步模型,以滿足不同專案的需求:
- 標準模型
- 真實模型
- 情緒感知寫實模型
標準唇形同步模型提供高效、跨平台的效能,並具備廣泛的角色相容性:
- 適用於 MetaHumans 及所有自訂角色類型
- 針對即時效能最佳化
- 更低的資源需求
- 平台支援:Windows、Android、Android 基礎平台(包含 Meta Quest)
要使用標準模型,您需要安裝額外的擴充外掛程式。請參閱先決條件章節以取得安裝說明。
寫實的嘴型同步模型專為 MetaHuman 角色提供增強的視覺保真度:
- 相容於 MetaHuman 與 ARKit 角色,具備進階臉部動畫(81 組臉部控制)
- 更高的視覺品質,嘴部動作更自然
- 效能需求略高
- 串流音訊處理,適用於即時應用
- 適合電影級體驗與近距離角色互動
- 三種最佳化等級:原始、半最佳化與高度最佳化
- 可設定的形變目標組合(請參閱 形變目標組合選擇)
- 平台支援:Windows、Mac、iOS、Linux、Android、Android 平台(包含 Meta Quest)
真實模型包含在主插件中,使用時無需任何額外擴充功能。
情緒感知的寫實模型能為 MetaHuman 角色提供具備情緒感知能力的臉部動畫:
- 相容於 MetaHuman 與 ARKit 角色,具備情緒反應式臉部動畫(81 組臉部控制)
- 12 種不同的情緒類型(中性、快樂、悲傷、自信等)
- 可設定的情緒強度(0.0 至 1.0)
- 可調整的前瞻時間以改善同步(20ms 至 200ms)
- 可選擇的輸出類型:全臉或僅嘴部控制
- 串流音訊處理,適用於即時應用
- 可設定的形變目標組合(請參閱形變目標組合選擇)
- 平台支援:Windows、Mac、iOS、Linux、Android、Android 平台(包含 Meta Quest)
情緒感知寫實模型包含在主插件中,使用時無需任何額外擴充功能。
您可以根據專案需求,選擇合適的模型,以符合效能、角色相容性、視覺品質、目標平台與功能需求。
運作方式
外掛程式以下列方式處理音訊輸入:
- 音訊資料以浮點數 PCM 格式接收,並帶有指定的聲道與取樣率
- 外掛程式會處理音訊,以根據模型產生臉部控制資料或視素(visemes)
- 對於支援情緒的模型,情緒脈絡會套用至臉部動畫
- 動畫資料會即時驅動角色的臉部動作
效能架構
Runtime MetaHuman Lip Sync 僅使用 CPU 推論,以提供一致且低延遲的唇形同步結果,適用於即時應用程式。預設情況下,此插件每 10 毫秒 執行一次唇形同步處理(可調整——請參閱 插件配置 以了解所有可用設定,包括 處理區塊大小、執行緒數量 及其他效能參數)。
模型架構總覽
唇形同步模型採用基於緊湊型Transformer的神經網路,透過梅爾頻譜分析來處理音訊。這種輕量級架構專為即時效能而設計,具備高效的CPU推論能力與極小的記憶體佔用。
為何選擇 CPU 推論?
對於小型且頻繁的推論操作(例如即時口型同步),CPU 處理在延遲特性上優於 GPU。在批次大小為 1、推論間隔為 10-100 毫秒的情況下,GPU 因 PCIe 傳輸和核心啟動所產生的開銷,往往超過實際的計算時間。此外,在遊戲引擎中,GPU 已因渲染、著色器和物理模擬而飽和,造成資源競爭,進而引入無法預測的延遲尖峰。
硬體相容性
此外掛在多數中階及以上的 CPU 上能高效運作,無需專用圖形硬體,即可在桌面、行動裝置及 VR 平台上提供即時效能。若硬體較弱,您可以將模型類型調整為半最佳化或高度最佳化,或增加**處理區塊大小**,以維持即時效能,但回應速度會略微降低。
快速開始
以下是為角色啟用嘴型同步的基本設定:
- 針對 MetaHuman 角色,請遵循設定指南
- 針對自訂角色,請遵循自訂角色設定指南
- 選擇並設定您偏好的口型同步模型
- 在您的 Blueprint 中設定音訊輸入處理
- 在 Animation Blueprint 中連接適當的口型同步節點
- 播放音訊,即可看到您的角色同步動畫
可選的眼睛動畫
此外,此外掛還包含用於 MetaHuman 的自動眨眼與視線追蹤選用輔助功能。這些功能與口型同步無關,可獨立使用,也可疊加於其上。請參閱眼睛動畫輔助功能。
額外資源
📦 下載與連結
示範專案:
提供兩個可直接使用的示範專案——完整詳情、下載與逐步解說請見專屬的示範專案頁面:
- 完整 AI 對話 NPC 工作流程 - 語音辨識 + LLM 聊天機器人 + TTS + 嘴型同步
- 基本嘴型同步示範 - 麥克風輸入、音訊檔案、TTS
兩個示範專案皆為跨平台(Windows、Mac、Linux、iOS、Android、Meta Quest),並以封裝建置版本及完整的 UE 5.6+ 原始碼專案形式提供。
🎥 影片教學
精選示範:
真實模型(高品質)教學:
- 從音訊檔案/緩衝區進行高品質口型同步
- 具情緒控制與本機 TTS 的高品質口型同步
- 搭配 ElevenLabs 與 OpenAI TTS 的高品質口型同步
- 高品質即時麥克風口型同步
- 適用於 ARKit 角色的高品質口型同步
標準模型教學:
一般設定:
💬 支援
- 客製化開發: solutions@georgy.dev(為團隊與組織提供的量身打造解決方案)