GANimate:超高效的口唇标志驱动的说话面部动画使用GAN特征上的学习卡尔曼波器 在移动设备上进行人机交互的潜空间
Ethan Fenakel1, Ben Ohayon1, Dan Raviv1
1School of Electrical and Computer Engineering, Tel Aviv University, Tel Aviv 6997801, Israel.
Sensors (Basel, Switzerland)
|February 27, 2026
概括
GANimate提供了一种轻量级的方法,可以使用生成对抗网络 (GAN) 来动画说话的面孔. 这种高效的方法可以在低资源设备上运行,从2D地标创建真实的唇部动作.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 现有的说话面部合成方法通常需要大量的计算资源,限制它们在边缘设备上的使用.
- 使用扩散模型,变压器或3DMM的方法是计算密集型的,并且对内存有很高的需求.
- 需要在移动和低资源平台上提供高效和易于使用的实时说话面部动画方法.
研究的目的:
- 为了介绍GANimate,一种新的,轻量级的方法来动画说话的面孔.
- 在低内存,低计算边缘设备上实现高效和高质量的说话面部合成.
- 提供一种方法,可以很容易地与现有的唇标生成器集成,而不需要预先培训.
主要方法:
- 利用生成对抗网络 (GANs) 的隐藏空间操纵.
- 使用从标准移动视觉传感器输入中提取的2D唇部地标作为几何约束.
- 采用卡尔曼波器,用于稳定的跟踪和视频合成期间的唇部标志的自适应性改进.
主要成果:
- 通过在GAN特征中优化隐藏空间,实现现实和富有表现力的唇部动作.
- 产生稳定和视觉连贯的动画,最小的计算开销.
- 证明了低资源边缘设备的高效运行,桥梁性能和可访问性.
结论:
- 在边缘设备上,GANimate提供了一个实用的解决方案,用于实时交谈面部合成.
- 该方法的轻量级设计和不需要预先培训的要求提高了其可访问性和集成性.
- 对移动人与计算机交互的真实时间化身来说,这是一个显著的进步.


