用多个传感器进行深度强化学习的多模式信息瓶.
1Department of Computer Science and Technology, Beijing National Research Centre for Information Science and Technology, Tsinghua University, Beijing 100084, China.
概括
这项研究引入了强化学习的多式联络信息瓶,通过有效地融合视觉和自身感知数据来改善机器人控制. 该方法提高了样本的效率和稳定性,超过了现有技术.
科学领域:
- 机器人技术 机器人技术 机器人技术
- 机器学习 机器学习
- 计算机视觉 计算机视觉
背景情况:
- 强化学习 (RL) 在机器人学中表现有前途,但在多式联络感官输入方面存在困难.
- 当前的方法使用辅助损失进行联合表示,但可能包括不相关的信息,阻碍性能.
- 多样化的感官数据的有效融合对于提高RL样本效率和政策学习至关重要.
研究的目的:
- 开发一种多式联络信息瓶模型,用于从自我中心的图像和自身感知中学习任务相关的联合表现.
- 通过有效地整合补充感官信息,提高机器人控制中的强化学习性能.
- 从原始的多式联运观测中过出与任务无关的信息.
主要方法:
- 提出了一种多式联运信息瓶 (MIB) 模型,以学习压缩的,与任务相关的联合表示.
- MIB压缩并保留来自多式联络观测 (图像和自身感知) 的预测信息.
- 通过将MIB目标的计算可处理性上限最小化来优化模型.
主要成果:
- 在挑战性机器人机动任务中,MIB模型展示了优异的样本效率.
- 与领先的基线相比,实现了与未见的白噪声相比显著的零射击强度.
- 经验证实,将自我中心的图像和自身感知结合在一起比使用单一的移动政策模式更有益.
结论:
- 拟议的多式联运信息瓶有效地从自我中心的图像和自身感知中学习压缩的,与任务相关的表示.
- 这种方法增强了机器人控制的强化学习,提高了样本的效率和稳定性.
- 利用来自多种感官模式的互补信息是提高机器人运动能力的关键.


