实时多人视频合成与可控制的先导贴
Aoran Chen1, Hai Huang1, Yueyan Zhu1
1School of Information and Communication Engineering, Beijing University of Posts and Telecommunications, Beijing 100876, China.
Sensors (Basel, Switzerland)
|May 11, 2024
概括
通过使用时间信息和可控制的生成模型,ControlMatting提高了复杂的多人场景的人类视频. 这种强大的实时方法在时间连贯性和细节方面取得了最先进的结果.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
背景情况:
- 现有的视频法经常独立处理,导致在多人场景中缺乏语义理解.
- 动态场景与多人呈现挑战准确的麻由于阻塞和复杂的相互作用.
研究的目的:
- 为多人动态场景引入一个强大的,实时的,高分辨率的,可控制的人类视频法.
- 通过利用时间信息来提高时间连贯性和详细的质量.
主要方法:
- 开发了ControlMatting,一个使用可控制生成模型和独立的反复架构来利用时间信息的统一架构.
- 采用混合培训策略,使用和语义细分数据集.
- 提出了一种基于深度学习的新型图像过算法,用于增强增强.
主要成果:
- 在人类视频合的所有指标上实现了最先进的性能.
- 在时间连贯性和详细地毯质量方面取得了显著的改进.
- 展示了使用先前的人体信息来克服掩盖缺陷的有效性.
结论:
- 在具有挑战性的多人动态环境中,ControlMatting提供了一种优越的视频合方法.
- 该方法能够整合时间信息和语义理解,从而提高了的准确性和质量.


