交叉模式对齐感知和多头自我注意力机制,用于人形机器人视觉语言行动
1Shanghai Key Laboratory of Intelligent Manufacturing and Robotics, School of Mechatronic Engineering and Automation, Shanghai University, Shanghai 200444, China.
Sensors (Basel, Switzerland)
|January 10, 2026
概括
人形机器人由于运动预测问题而难以完成复杂的任务. 一个新的记忆门过注意力模型增强视觉语言动作 (VLA) 学习,提高任务成功和减少机器人手臂的动.
科学领域:
- 机器人技术 机器人技术 机器人技术
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 人形机器人面临的挑战是精确的运动轨迹预测复杂的,多步骤的任务,往往导致机器人手臂.
- 端到端模仿学习和视觉语言行动 (VLA) 模型虽然有希望,但可能会受到高计算复杂性的影响,特别是在自我注意力机制中.
研究的目的:
- 解决人形机器人当前模仿学习方法的局限性.
- 为了减少VLA操作中的自我注意模块的计算复杂性.
- 为了提高运动预测的准确性,并在复杂的任务中减少人形机器人手臂的动.
主要方法:
- 提出了一种新的记忆门过注意力模型,以改善多头自我注意力机制.
- 开发了一种用于增强培训的跨模式对齐感知策略.
- 在关键任务步骤中实施了几次拍摄数据收集方法.
主要成果:
- 在人形机器人中显著提高任务成功率.
- 有效地缓解了机器人手臂动的问题.
- 视频内存使用量减少了72%,训练速度提高了10倍以上 (每批从1.35秒到0.129秒).
结论:
- 拟议的存储门过注意力模型增强了人形机器人的VLA操作.
- 这种方法成功地提高了任务性能,减少了计算负载,并提高了培训效率.
- 这种方法为复杂的机器人操纵任务提供了更强大,更准确的解决方案.


