基于局部到全球隐藏扩散的表达式3D面部动画生成
IEEE transactions on visualization and computer graphics
|September 10, 2024
概括
这项研究引入了一种新方法,用于生成与音频同步的现实 3D 面部动画. 这种方法在数字媒体中增强了情感真实性,改善了增强现实和混合现实体验.
科学领域:
- 计算机图形 计算机图形
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 3D面部动画对于增强现实和混合现实 (AR/MR) 至关重要,但与真实的情感表达扎.
- 现有的面部动画方法缺乏真正的情感表现所需的细微差别.
研究的目的:
- 开发一种新的方法来捕捉微妙的面部表情并生成真实,音频同步的3D面部动画.
- 通过现实的面部动画来增强AR / MR应用程序的情感深度和沉浸式质量.
主要方法:
- 引入了局部到全球潜伏扩散模型 (LG-LDM),集成音频,时间和表达条件,用于编码富含情感的特征.
- 在LG-LDM中开发了一种面部Denoiser模型 (FDM),以与音频信号对准本地到全球动画特征.
- 重新设计了一种以情感为中心的向量定量变量自编码器 (EVQ-VAE),用于精确解码微妙的情感差异和3D面部几何结构重建.
主要成果:
- 提出的方法有效地产生了与音频输入同步的情感逼真的3D面部动画.
- LG-LDM和EVQ-VAE成功捕捉和重建微妙的面部表情,提高动画真实性.
- 该方法解决了音频驱动,情感逼真的面部动画的关键挑战.
结论:
- 这项工作显著推进了为AR/MR生成情感逼真的3D面部动画的最先进技术.
- 开发的模型增强了数字媒体应用中的沉浸式体验和情感深度.
- 提供了一个包含代码和数据的可复制性套件,以促进进一步的研究.


