启发式密集奖励塑造用于工业自动移动机器人的基于学习的无地图导航
Yizhi Wang1, Yongfang Xie1, Degang Xu1
1School of Automation, Central South University, Changsha, 410083, China.
ISA transactions
|November 14, 2024
概括
本研究介绍了使用深度强化学习 (DRL) 的工业机器人无地图导航系统. 它提高了机器人的效率和适应性,而不需要更新地图,为传统方法提供了切实可行的替代方案.
科学领域:
- 机器人技术 机器人技术 机器人技术
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 工业自动移动机器人 (AMR) 通常依赖固定标记或频繁地图更新进行导航.
- 现有的方法可能是计算密集的,昂贵的,在动态的工业环境中缺乏适应性.
研究的目的:
- 为AMR开发一种无地图导航方法,这种方法在计算上是高效的,具有成本效益和适应性.
- 提高学习效率,并使用一种新的奖励塑造技术减少AMR中低于最佳的行动.
主要方法:
- 利用深度强化学习 (DRL) 进行实时决策,而不依赖固定标记或地图.
- 引入了启发潜在现场方法的启发式密集奖励塑造 (HDRS),以整合领域知识和增强学习.
- 采用数据增强与受控传感器噪声来弥合模拟与现实之间的差距,并确保现实世界的稳定性.
主要成果:
- 与基线方法相比,HDRS表现出优越的融合速度,培训稳定性和政策学习效率.
- 在模拟和现实世界的评估中,HDRS-DRL方法显示出具有竞争力的性能.
- 该系统实现了强大的通用化,可用于现实世界的部署,而不需要微调.
结论:
- 拟议的使用HDRS-DRL的无地图导航系统为工业AMR提供了实用和高效的解决方案.
- 这种方法优于传统的导航方法,提供了更好的适应性和成本效益.
- 该研究验证了通过DRL在机器人导航中的奖励塑造来整合领域知识的有效性.


