Gesture2Text:一个可通用的解码器,用于XR的文字手势键盘,通过轨迹粗分离和预训练
IEEE transactions on visualization and computer graphics
|September 16, 2024
概括
一个新的预训练的神经解码器在扩展现实 (XR) 中提高了文字手势键盘 (WGK) 精度,比SHARK2.2提高了37.2%. 这种可通用解码器在一个小的实时可操作模型中提供了高精度.
科学领域:
- 人与计算机的交互
- 虚拟现实和增强现实
- 机器学习 机器学习
背景情况:
- 文字手势键盘 (WGK) 是扩展现实 (XR) 中的关键交互,但由于不同的交互模式和数据模式,解码文字手势轨迹是复杂的.
- 像SHARK2这样的模板匹配方法很常见,但与杂的轨迹作斗争,而传统的神经解码器需要广泛的数据和专业知识.
- 现有的方法在准确性,数据要求和WGK系统的实施复杂性方面面临挑战.
研究的目的:
- 为WGK系统开发一种新的,可通用的神经解码器,该解码器将易于实现与高解码精度相结合.
- 解决现有的模板匹配和基于神经网络的解码器对于WGK轨迹解码的局限性.
- 创建一个即用WGK解码器,适用于各种XR环境和交互类型.
主要方法:
- 提出了一种可通用的神经解码器,可以通过对大规模,粗略分离的文字手势轨迹进行预训练来实现.
- 在增强现实 (AR) 和虚拟现实 (VR) 中对空中和地面WGK系统评估解码器的性能.
- 将预先训练的解码器量化为4MB,并在Quest 3设备上测量其实时执行性能.
主要成果:
- 在四个不同的数据集中实现了强大的平均Top-4准确率90.4%,证明了广泛的概括性.
- 显著优于SHARK2的37.2%和传统的神经解码器的7.4%.
- 量子解码器保持了准确度,虽然只有4MB,在Quest 3上在97毫秒内执行,从而实现实时性能.
结论:
- 拟议的预训练的神经解码器为XR中WGK轨迹解码提供了高度准确和高效的解决方案.
- 这种方法克服了现有方法的局限性,为各种AR和VR应用提供了可泛化和易于实施的解码器.
- 解码器的小尺寸和实时功能使其适合在资源有限的XR硬件上部署.


