哈维特:研究智能家具的视觉语言手势交互机制
Hong Chen1,2, Hasnul Azwan Azizan Mahdzir3, Xuekun Li4
1School of Art and Design, Jiangxi University of Technology, Nanchang, China. chenhong245068@gmail.com.
Scientific reports
|July 28, 2025
概括
这项研究介绍了HAVIT,这是一种混合深度学习模型,用于在智能家具中强大的手势识别,即使数据有限. 它通过结合视觉转换器和ALBEF来改进交互技术,以更好地提取特征和语义理解.
科学领域:
- 人与计算机的交互
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 手势识别是直观智能家具互动的关键.
- 有限的数据和语义理解阻碍了当前的手势识别有效性.
- 解决这些挑战对于实际的智能家具应用至关重要.
研究的目的:
- 提出HAVIT,一种用于增强手势识别的混合深度学习模型.
- 为了提高智能家具互动在数据稀缺条件下的性能.
- 利用视觉转换器和ALBEF进行特征提取和语义理解.
主要方法:
- 开发了HAVIT,这是一个混合深度学习模型,集成了Vision Transformer和ALBEF.
- 利用视觉变压器来有效地提取特征.
- 使用ALBEF来增强手势的语义理解.
主要成果:
- 在一个完全标记的数据集上,获得了91.83%的准确性和0.92 AUC.
- 保持了86.89%的准确性和0.88 AUC在20%的标签缺陷下.
- 在数据稀缺的场景中表现出强大的稳定性和性能.
结论:
- 哈维特为智能家具中的手势识别提供了强大的解决方案.
- 该模型有效地解决了数据稀缺和语义理解的局限性.
- 这些发现对推进智能家具交互技术具有重大意义.


