大型生成模型通过可变形的近似大核追求推动轻量级凝视估计器
概括
这项研究引入了一种新的轻量级网络,用于在移动设备上准确地估计目光. 它通过使用可变形的内核和利用生成模型来提高概括性来实现高性能.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人与计算机的交互
背景情况:
- 轻量级的目光估计对于移动AR/VR应用程序至关重要.
- 当前的深度学习模型面临着计算成本和概括性的挑战.
- 现有的方法与不同的眼睛外观和微妙的瞳孔运动作斗争.
研究的目的:
- 开发一种高效准确的轻量级目光估计方法.
- 为了解决沉重的计算架构和当前模型中不良概括性的局限性.
- 在资源有限的移动平台上实现强大的凝视跟踪.
主要方法:
- 提出了一个新的轻量级网络,具有可变形的大型核.
- 扩大受体场以处理复杂的眼动和外观变化.
- 集成的目光估计培训与控制信息提取模块.
- 使用大型生成模型 (稳定扩散V1.5) 来生成视线特定的图像.
- 从生成模型中提炼了概括能力,进入了轻量级的凝视模型.
主要成果:
- 与最先进的方法相比,拟议的模型显示出更高的准确性.
- 在显著降低模型复杂性的情况下实现了高性能.
- 有效地处理各种眼睛纹理和微妙的瞳孔运动.
- 验证了可变形内核和生成模型集成的有效性.
结论:
- 这种新的轻量级网络为视线估计提供了高效和准确的解决方案.
- 拟议的培训计划成功地从大型生成模型中提取了概括.
- 这种方法适用于移动设备和AR/VR系统的部署.
- 代表了实时,在设备上注视追踪技术的重大进步.


