Multi-input and Multi-variable systems
Observational Learning
Predicting Reaction Outcomes
Associative Learning
Attribution Theory
Reinforcement
您也可能阅读
通过共同作者、期刊和引用图与本文相关的文章。
1School of Intelligence Science and Technology, Peking University, Beijing, 100871, China.
本研究介绍了预测性贡献测量,这是一种用于多代理强化学习的新型学分分配方法. PC-MAPPO增强了政策梯度方法,在复杂的合作任务中表现优于现有的方法.
科学领域:
背景情况:
研究的目的:
主要方法:
主要成果:
结论: