通过层次任务网络增强的多代理强化学习:朝着高效的合作策略
Xuechen Mu1, Hankz Hankui Zhuo2, Chen Chen3
1School of Mathematics, Jilin University, Changchun, 130012, Jilin, China.
概括
层次符号多代理增强学习 (HS-MARL) 增强了在稀疏奖励环境中的探索. 这种新的方法显著优于现有方法,特别是在具有挑战性的非最佳设置中.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 机器人技术 机器人技术 机器人技术
背景情况:
- 多代理强化学习 (MARL) 在奖励稀少的环境中面临重大挑战,往往导致过早停止探索.
- 低于最佳的勘探策略阻碍了MARL剂在复杂场景中的性能.
研究的目的:
- 引入层次符号多代理增强学习 (HS-MARL),这是一个新的框架,旨在减轻MARL的探索困难.
- 通过结合层次知识和符号表示来减少有效的探索空间.
主要方法:
- HS-MARL使用中间状态分解状态空间,并通过层次域定义语言 (HDDL) 和选项框架表示域知识.
- 一个增强的层次任务网络 (HTN) 规划器,pyHIPOP+,生成动作序列,这些动作序列被高级元控制器分配为策略函数.
- 内在奖励由元控制器计算,以训练象征性选项策略,并完善pyHIPOP+启发式函数.
主要成果:
- 在稀疏的奖励和低于最佳的环境中,HS-MARL在15个最先进的算法中显示出显著的性能改进.
- 废弃性研究证实了HS-MARL的内在奖励机制和pyHIPOP+成分对其有效性的关键贡献.
- 该方法在模拟的稀疏奖励环境和现实世界足球比赛场景中得到了验证.
结论:
- HS-MARL提供了一个强大的解决方案,用于导航复杂的MARL环境,奖励稀少,条件不佳.
- 层次知识,象征性选项和内在奖励的整合是提高探索和代理性能的关键.
- 开发的框架为推进MARL研究和应用提供了一个有希望的方向.


