突出利益选项:具有突出利益函数的时间抽象
Xianchao Zhu1, Liang Zhao2, William Zhu3
1Key Laboratory of Grain Information Processing and Control (Henan University of Technology), Ministry of Education, 450001, Zhengzhou, China; Henan Key Laboratory of Grain Photoelectric Detection and Control, Henan University of Technology, 450001, Zhengzhou, China; School of Artificial Intelligence and Big Data, Henan University of Technology, 450001, Zhengzhou, China.
本研究介绍了强化学习 (RL) 的突出兴趣选项批评 (SIOC). SIOC提高了数据效率和灵活性,提高了发现选项的可能性,提高了代理的性能和可重复使用性.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 强化学习是一种强化学习.
背景情况:
- 强化学习 (RL) 代理人通过与环境互动来学习最佳政策.
- 时间抽象或选项允许RL代理人在可变的时间尺度上做出决定.
- 现有的方法,如利息选项批评 (IOC) 专业化选项,但面临数据效率低下和不灵活.
研究的目的:
- 提出一种新的方法,即 Salience Interest Option Critic (SIOC),用于在 RL 中更高效,更灵活地发现选项.
- 解决基于反向传播的方法在端到端学习选项中的局限性.
- 提高学习选项的价值,可解释性和可重复使用性.
主要方法:
- SIOC使用颗粒过器选择启动集的子集,避免缓慢和过的反向传播.
- 该方法仅使用奖励反来快速灵活地识别关键子集.
- 在离散和连续领域进行了实验.
主要成果:
- 与现有方法相比,SIOC显示出更高的效率和灵活性.
- 学习的选项在单个任务中更有价值.
- 由SIOC生成的选项在多任务学习场景中显示出更大的可解释性和可重复使用性.
结论:
- SIOC在RL选项发现方面取得了重大进展,克服了先前工作的关键局限性.
- 基于颗粒过器的方法为学习专业选项提供了更强大,更适应的方法.
- 在效率,灵活性和选项可重复使用性方面SIOC的改进对RL研究和应用具有广泛的影响.
更多相关视频
08:24The Joint Effect of Social Comparison and Social Distance on Evaluation of Intertemporal Choice Outcomes in Event-related Potential Studies
Published on: August 25, 2023
13:04Measuring the Subjective Value of Risky and Ambiguous Options using Experimental Economics and Functional MRI Methods
Published on: September 19, 2012
相关概念视频
Subliminal Perception
Graded Potential
Graded potentials fall into two categories: depolarizing and hyperpolarizing. Depolarizing graded potentials typically occur when sodium (Na+) or...
