人类指导的增强学习与模拟到真实转移用于自主导航
IEEE transactions on pattern analysis and machine intelligence
|September 13, 2023
概括
人类指导增强无人地面车辆 (UGV) 的强化学习 (RL). 该框架在模拟和现实世界部署中提高了导航性能,克服了当前RL方法的局限性.
科学领域:
- 机器人和人工智能 机器人和人工智能
- 机器学习用于自主系统
背景情况:
- 强化学习 (RL) 对无人地面车辆 (UGV) 显示出希望,但由于有限的计算资源和在训练导航任务中的困难,它面临着挑战.
- 当前的RL方法表现出有限的智力,经常在角落情况下失败,需要广泛,精心设计的奖励功能和交互.
- 模拟培训与现实世界部署之间的差距 (模拟与现实差距) 阻碍了RL在UGV中的实际应用.
研究的目的:
- 提出一个由人类指导的强化学习 (RL) 框架,以提高无人地面车辆 (UGV) 在导航中的性能.
- 通过整合人类智能和干预来提高在模拟学习和现实世界部署期间的RL能力.
- 解决当前RL方法在计算资源,训练复杂性和在不同环境中的稳定性方面的局限性.
主要方法:
- 开发了一种新的人为导向的RL算法,结合了人为导向的学习目标,优先考虑的人体经验重复和基于人类干预的奖励塑造.
- 采用了对域调整的无效表示,以减轻模拟与现实之间的差距,从而使学习从模拟到现实世界有效地转移.
- 通过使用最小的神经网络和基于图像的输入的UGV进行广泛的模拟和现实世界的实验来验证该方法.
主要成果:
- 人类指导的RL框架在多样化和动态环境中显著提高了UGV导航性能,超过了现有的学习和基于模型的方法.
- 与传统的RL导航技术相比,该方法显示出更高的目标实现能力和更高的安全性.
- 该方法证明对输入特征和自我动态的变化具有稳定性,并使用小规模的人类演示实现了对所需行为的在线学习.
结论:
- 将人类智能与强化学习相结合,为开发无人地面车辆有能力和强大的导航系统提供了强大的解决方案.
- 拟议的人类指导的RL框架有效地克服了传统RL的局限性,使得在现实场景中实现高效的学习和部署.
- 这种方法为更智能,更适应性的自主导航系统铺平了道路,即使计算资源有限.


