基因安全:一种可泛化的安全增强器,用于基于减少顺序马尔科夫决策过程模型的安全增强学习算法
概括
这项研究介绍了GenSafe,这是一种用于安全强化学习 (SRL) 的新型安全增强剂. 基因安全通过解决数据不足和提高深度强化学习算法的约束满意度来改善早期学习.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 机器人技术 机器人技术 机器人技术
背景情况:
- 安全强化学习 (SRL) 将安全约束纳入深度强化学习 (DRL).
- 由于早期学习阶段的数据不足,SRL的有效性受到限制,这阻碍了准确的功能近似.
- 现有的SRL方法在初始培训阶段难以提供可靠的安全性.
研究的目的:
- 介绍GenSafe,这是SRL的一种可泛化的安全增强剂.
- 在早期的SRL中克服数据不足的挑战.
- 提高DRL代理人的安全性能和约束满足.
主要方法:
- 利用杆模型减少订单的技术来构建一个减少订单的马尔科夫决策过程 (ROMDP).
- 使用ROMDP作为原始安全约束的低维近值.
- 通过解决基于ROMDP的约束来完善代理行动,以提高安全性.
主要成果:
- 基因安全显著提高了安全性能,特别是在SRL的早期学习阶段.
- 该方法有效地解决了初级培训中常见的数据不足问题.
- 保持了令人满意的任务性能,并提高了安全性.
结论:
- 对于SRL算法来说,GenSafe是一种有效的额外安全层.
- 该方法表明与各种SRL方法和问题具有广泛的兼容性.
- 基因安全为增强现有的SRL方法提供了一种新的解决方案,以提高安全性和学习效率.
更多相关视频
08:05A Prediction Error-driven Retrieval Procedure for Destabilizing and Rewriting Maladaptive Reward Memories in Hazardous Drinkers
Published on: January 5, 2018
9.7K
07:19A Modified Lean and Release Technique to Emphasize Response Inhibition and Action Selection in Reactive Balance
Published on: March 19, 2020
5.7K
