在自我中心的视频中以目标为导向的提示与适应性模式选择,以有效地预测装配活动
IEEE transactions on pattern analysis and machine intelligence
|January 13, 2026
概括
本研究介绍了一种以目标为导向的提示框架,具有适应性模式选择 (GP-AMS),用于使用自我中心视频预测未来的组装任务. 该方法提高了准确性,同时提高了实际AR应用的计算效率.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 增强现实 (AR) 设备具有自我中心的观察和多模式感知,为组装任务中的智能助理提供了潜力.
- 在以自我为中心的视频中预测未来的活动对于人机协作至关重要,但在准确性和计算效率方面面临挑战.
研究的目的:
- 从自我中心的视频开发一种高效准确的方法来预测近期的组装活动.
- 在现有的自我中心活动预测模型中解决准确性和计算成本之间的权衡问题.
主要方法:
- 提出了一个以目标为导向的提示框架,具有适应性模式选择 (GP-AMS).
- 将高级目标线索注入提示中,以指导视觉语言 (V-L) 模型用于未来活动预测.
- 采用了掩盖和预测策略,随机掩盖和概率性令牌丢失.
- 开发了一个自适应模式选择策略,以动态选择模式,优化计算负载.
主要成果:
- 在GP-AMS框架中,公开数据集的预测准确性得到了持续的改进.
- 与现有方法相比,在计算预算上实现了显著的节约.
- 验证了这种方法对现实世界AR设备的可行性.
结论:
- 拟议的GP-AMS方法有效地弥合了预测未来活动的语义差距.
- 在自我中心的活动预测中,在准确性和计算效率之间取得了卓越的平衡.
- 在组装任务中为先进的智能助理的实际部署铺平了道路.
更多相关视频
10:11Portable Intermodal Preferential Looking IPL: Investigating Language Comprehension in Typically Developing Toddlers and Young Children with Autism
Published on: December 14, 2012
19.0K
06:25Capturing Representative Hand Use at Home Using Egocentric Video in Individuals with Upper Limb Impairment
Published on: December 23, 2020
2.9K
