Tổng quan

Runtime MetaHuman Lip Sync là một plugin cho phép đồng bộ khẩu hình miệng theo thời gian thực, ngoại tuyến và đa nền tảng cho cả MetaHuman lẫn nhân vật tùy chỉnh. Plugin này cho phép bạn tạo hoạt ảnh cho môi của nhân vật phản hồi theo đầu vào âm thanh từ nhiều nguồn khác nhau, bao gồm:
- Đầu vào micro qua sóng âm có thể thu được của Runtime Audio Importer
- Giọng nói tổng hợp từ Runtime Text To Speech hoặc Runtime AI Chatbot Integrator
- Dữ liệu âm thanh phát trực tuyến hoặc nhập vào ở nhiều định dạng qua Runtime Audio Importer
- Bất kỳ dữ liệu âm thanh nào ở định dạng PCM float (một mảng các mẫu dấu phẩy động)
Plugin nội bộ tạo ra viseme (biểu diễn trực quan của âm vị) dựa trên dữ liệu âm thanh đầu vào. Vì hoạt động trực tiếp với dữ liệu âm thanh thay vì văn bản, plugin hỗ trợ đầu vào đa ngôn ngữ bao gồm nhưng không giới hạn ở tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Nhật, tiếng Trung, tiếng Hàn, tiếng Nga, tiếng Ý, tiếng Bồ Đào Nha, tiếng Ả Rập và tiếng Hindi. Về cơ bản, mọi ngôn ngữ đều được hỗ trợ vì lip sync được tạo ra từ âm vị của âm thanh thay vì xử lý văn bản theo ngôn ngữ cụ thể.
Standard Model tạo ra 14 viseme và thực hiện hoạt ảnh khớp môi bằng cách sử dụng một pose asset được định nghĩa sẵn. Ngược lại, Realistic Models (độc quyền cho các nhân vật dựa trên MetaHuman và ARKit) tạo ra 81 thay đổi điều khiển khuôn mặt mà không phụ thuộc vào pose asset được định nghĩa sẵn, mang lại hoạt ảnh khuôn mặt chân thực hơn đáng kể.
Khả năng tương thích nhân vật
Dù có tên như vậy, Runtime MetaHuman Lip Sync vẫn hoạt động với nhiều loại nhân vật ngoài MetaHuman:
Hệ thống nhân vật thương mại phổ biến
- Daz Genesis 8/9 nhân vật
- Reallusion Character Creator 3/4/5 (CC3/CC4/CC5) nhân vật
- Mixamo nhân vật
Hỗ trợ Tiêu chuẩn Hoạt hình
- Hệ thống blendshape dựa trên FACS
- Tiêu chuẩn blendshape ARKit của Apple
- Bộ âm vị Preston Blair
- Hệ thống âm vị 3ds Max
- Bất kỳ nhân vật nào có morph target tùy chỉnh cho biểu cảm khuôn mặt
Nhiều hệ thống phổ biến, bao gồm Reallusion CC4/CC5 và Daz Genesis 8.1/9, cũng có thể được chuyển đổi để sử dụng tên blendshape chuẩn ARKit. Điều này cho phép bạn dùng Realistic Model cho các nhân vật này, với hoạt ảnh khuôn mặt chất lượng cao hơn, như một lựa chọn thay thế cho việc ánh xạ viseme thủ công của Standard Model. Xem Chuyển đổi Nhân vật sang Blendshape ARKit để biết chi tiết.
Đối với các nhân vật không phải MetaHuman sử dụng Standard Model, hãy xem Hướng dẫn Thiết lập Nhân vật Tùy chỉnh. Đối với các nhân vật dựa trên ARKit sử dụng Realistic Models, hãy xem Lựa chọn Bộ Morph Target.
Xem trước hoạt ảnh
Hãy xem các đoạn hoạt ảnh ngắn này để thấy chất lượng hoạt ảnh khớp khẩu hình (lip sync) mà plugin tạo ra trên nhiều loại nhân vật và mô hình khác nhau:
Tính năng chính
- Khớp môi theo thời gian thực từ đầu vào microphone
- Hỗ trợ xử lý âm thanh ngoại tuyến
- Tương thích đa nền tảng với hỗ trợ nền tảng cụ thể theo từng mô hình
- Hỗ trợ nhiều hệ thống nhân vật và tiêu chuẩn hoạt hình
- Ánh xạ viseme linh hoạt cho nhân vật tùy chỉnh
- Hỗ trợ ngôn ngữ phổ quát - hoạt động với mọi ngôn ngữ nói thông qua phân tích âm thanh
- Hoạt hình khuôn mặt theo cảm xúc để tăng cường biểu cảm
- Các loại đầu ra có thể cấu hình (điều khiển toàn khuôn mặt hoặc chỉ miệng)
- Công cụ hỗ trợ hoạt hình mắt tùy chọn cho chớp mắt và theo dõi ánh nhìn
Mô hình Lip Sync
Plugin cung cấp nhiều mô hình lip sync để phù hợp với nhu cầu khác nhau của dự án:
- Mô hình Standard
- Mô hình chân thực
- Mô hình thực tế hỗ trợ cảm xúc
Mô hình lip sync tiêu chuẩn cung cấp hiệu suất đa nền tảng hiệu quả với khả năng tương thích nhân vật rộng rãi:
- Hoạt động với MetaHumans và mọi loại nhân vật tùy chỉnh
- Tối ưu hóa cho hiệu suất thời gian thực
- Yêu cầu tài nguyên thấp hơn
- Hỗ trợ nền tảng: Windows, Android, các nền tảng dựa trên Android (bao gồm Meta Quest)
Để sử dụng Standard Model, bạn cần cài đặt một plugin mở rộng bổ sung. Xem phần Điều kiện tiên quyết để biết hướng dẫn cài đặt.
Mô hình khớp khẩu hình (lip sync) chân thực mang lại độ trung thực hình ảnh được nâng cao, dành riêng cho các nhân vật MetaHuman:
- Tương thích với MetaHuman và các nhân vật dựa trên ARKit với hoạt ảnh khuôn mặt nâng cao (81 điều khiển khuôn mặt)
- Chất lượng hình ảnh cao hơn với chuyển động miệng tự nhiên hơn
- Yêu cầu hiệu suất cao hơn một chút
- Xử lý âm thanh phát trực tuyến cho các ứng dụng thời gian thực
- Lý tưởng cho trải nghiệm điện ảnh và tương tác nhân vật cận cảnh
- Ba mức tối ưu hóa: Original, Semi-Optimized và Highly Optimized
- Bộ morph target có thể cấu hình (xem Chọn Bộ Morph Target)
- Hỗ trợ nền tảng: Windows, Mac, iOS, Linux, Android, các nền tảng dựa trên Android (bao gồm Meta Quest)
Mô hình Realistic được bao gồm trong plugin chính và không yêu cầu bất kỳ tiện ích mở rộng bổ sung nào để sử dụng.
Mô hình thực tế hỗ trợ cảm xúc cung cấp hoạt ảnh khuôn mặt nhận biết cảm xúc cho các nhân vật MetaHuman:
- Tương thích với các nhân vật dựa trên MetaHuman và ARKit với hoạt ảnh khuôn mặt phản ứng theo tâm trạng (81 bộ điều khiển khuôn mặt)
- 12 loại tâm trạng khác nhau (Trung lập, Vui vẻ, Buồn bã, Tự tin, v.v.)
- Cường độ tâm trạng có thể cấu hình (0.0 đến 1.0)
- Thời gian nhìn trước có thể điều chỉnh để cải thiện đồng bộ hóa (20ms đến 200ms)
- Các loại đầu ra có thể chọn: Điều khiển Toàn bộ Khuôn mặt hoặc Chỉ Miệng
- Xử lý âm thanh trực tuyến cho các ứng dụng thời gian thực
- Các bộ morph target có thể cấu hình (xem Lựa chọn Bộ Morph Target)
- Hỗ trợ nền tảng: Windows, Mac, iOS, Linux, Android, các nền tảng dựa trên Android (bao gồm Meta Quest)
Mô hình Thực Tế Hỗ Trợ Cảm Xúc được bao gồm trong plugin chính và không yêu cầu bất kỳ tiện ích mở rộng bổ sung nào để sử dụng.
Bạn có thể chọn mô hình phù hợp dựa trên yêu cầu dự án của mình về hiệu suất, khả năng tương thích nhân vật, chất lượng hình ảnh, nền tảng mục tiêu và nhu cầu tính năng.
Cách thức hoạt động
Plugin xử lý đầu vào âm thanh theo cách sau:
- Dữ liệu âm thanh được nhận dưới dạng định dạng PCM float với số kênh và tốc độ mẫu được chỉ định
- Plugin xử lý âm thanh để tạo ra dữ liệu điều khiển khuôn mặt hoặc viseme tùy thuộc vào mô hình
- Đối với các mô hình hỗ trợ cảm xúc, ngữ cảnh cảm xúc được áp dụng vào hoạt ảnh khuôn mặt
- Dữ liệu hoạt ảnh điều khiển chuyển động khuôn mặt của nhân vật theo thời gian thực
Kiến trúc Hiệu suất
Runtime MetaHuman Lip Sync sử dụng suy luận chỉ trên CPU để mang lại kết quả khớp môi nhất quán, độ trễ thấp, phù hợp cho các ứng dụng thời gian thực. Theo mặc định, plugin xử lý khớp môi mỗi 10 mili giây (có thể điều chỉnh - xem Cấu hình Plugin để biết tất cả các cài đặt khả dụng bao gồm Kích thước Khối Xử lý, số luồng và các tham số hiệu suất khác).
Tổng quan Kiến trúc Mô hình
Các mô hình lip sync sử dụng một mạng nơ-ron transformer nhỏ gọn, xử lý âm thanh thông qua phân tích mel-spectrogram. Kiến trúc nhẹ này được thiết kế đặc biệt cho hiệu suất thời gian thực với khả năng suy luận CPU hiệu quả và mức sử dụng bộ nhớ tối thiểu.
Tại sao lại suy luận bằng CPU?
Đối với các hoạt động suy luận nhỏ và thường xuyên như khớp chuyển động môi theo thời gian thực, xử lý bằng CPU mang lại đặc tính độ trễ tốt hơn so với GPU. Ở kích thước lô 1 với khoảng thời gian suy luận 10-100ms, chi phí GPU từ việc truyền PCIe và khởi chạy kernel thường vượt quá thời gian tính toán thực tế. Ngoài ra, trong các game engine, GPU đã bị bão hòa bởi việc kết xuất, shader và vật lý, tạo ra sự tranh chấp tài nguyên gây ra các đợt tăng độ trễ khó lường.
Tương thích phần cứng
Plugin hoạt động hiệu quả trên hầu hết các CPU tầm trung và cao cấp mà không yêu cầu phần cứng đồ họa chuyên dụng, mang lại hiệu suất thời gian thực trên các nền tảng desktop, mobile và VR. Đối với phần cứng yếu hơn, bạn có thể điều chỉnh Loại Mô Hình thành Bán Tối Ưu hoặc Tối Ưu Cao, hoặc tăng Kích Thước Khối Xử Lý để duy trì hiệu suất thời gian thực với độ phản hồi giảm nhẹ.
Bắt đầu nhanh
Đây là thiết lập cơ bản để kích hoạt khớp môi (lip sync) cho nhân vật của bạn:
- Đối với nhân vật MetaHuman, hãy làm theo Hướng dẫn thiết lập
- Đối với nhân vật tùy chỉnh, hãy làm theo Hướng dẫn thiết lập nhân vật tùy chỉnh
- Chọn và cấu hình mô hình lip sync ưa thích của bạn
- Thiết lập xử lý đầu vào âm thanh trong Blueprint của bạn
- Kết nối nút lip sync phù hợp trong Animation Blueprint
- Phát âm thanh và xem nhân vật của bạn hoạt hình đồng bộ
Tùy chọn Hoạt ảnh Mắt
Plugin cũng bao gồm các công cụ hỗ trợ tùy chọn cho chớp mắt tự động và theo dõi ánh mắt trên MetaHumans. Các tính năng này độc lập với lip sync và có thể được sử dụng riêng lẻ hoặc xếp lớp lên trên nó. Xem Trợ giúp Hoạt ảnh Mắt.
Tài nguyên bổ sung
📦 Tải xuống & Liên kết
Dự án Demo:
Hai dự án demo sẵn sàng sử dụng có sẵn - xem trang Dự án Demo chuyên dụng để biết chi tiết đầy đủ, bản tải xuống và hướng dẫn từng bước:
- Quy trình NPC Hội thoại AI Đầy đủ - nhận dạng giọng nói + chatbot LLM + TTS + khớp môi
- Bản demo Khớp môi Cơ bản - đầu vào micro, tệp âm thanh, TTS
Cả hai bản demo đều đa nền tảng (Windows, Mac, Linux, iOS, Android, Meta Quest) và được phát hành dưới dạng bản build đóng gói cùng dự án nguồn UE 5.6+ đầy đủ.
🎥 Video Hướng dẫn
Demos nổi bật:
Hướng dẫn Mô hình Chân thực (Chất lượng Cao):
- Khớp khẩu hình chất lượng cao từ Tệp/Bộ đệm Âm thanh
- Khớp khẩu hình chất lượng cao với Kiểm soát Cảm xúc & TTS cục bộ
- Khớp khẩu hình chất lượng cao với ElevenLabs & OpenAI TTS
- Khớp khẩu hình chất lượng cao từ Microphone trực tiếp
- Khớp khẩu hình chất lượng cao cho Nhân vật ARKit
Hướng dẫn Mô hình Tiêu chuẩn:
- Khớp khẩu hình micro trực tiếp chuẩn
- Khớp khẩu hình chuẩn với chuyển văn bản thành giọng nói cục bộ
- Khớp khẩu hình chuẩn với ElevenLabs & OpenAI TTS
Thiết lập chung:
- Thêm Nhân Vật MetaHuman Tùy Chỉnh vào Dự Án Demo
- Video hướng dẫn thiết lập
- Chớp Mắt MetaHuman & Theo Dõi Camera
- Kết Hợp với Hoạt Ảnh Khuôn Mặt và Cơ Thể
💬 Hỗ trợ
- Phát triển tùy chỉnh: solutions@georgy.dev (giải pháp được thiết kế riêng cho nhóm & tổ chức)