一个事件触发的深度强化学习指导算法,用于拦截速度优势的机动目标
Xu Wang1, Yifan Deng1, Yuanli Cai1
1Faculty of Electronic and Information Engineering, Xi'an Jiaotong University, Xi'an 710049, China.
ISA transactions
|May 11, 2025
概括
本研究介绍了一种事件触发的深度强化学习 (ETDRL) 算法,用于更快地训练指导法. 新的框架改善了对高速目标的拦截,提高了对传统方法的效率和性能.
科学领域:
- 航空航天工程 航空航天工程
- 控制系统 控制系统
- 人工智能的人工智能
背景情况:
- 传统的指导法则与高速的机动目标作斗争.
- 深度强化学习 (DRL) 是有前途的,但由于政策培训效率低下而受到影响.
- 超音速车辆拦截需要先进的指导策略.
研究的目的:
- 开发一种新的事件触发深度强化学习 (ETDRL) 算法,以提高指导法律培训效率.
- 在高速拦截场景中解决传统指导法律和DRL的局限性.
- 为了提高拦截机动目标的速度优势在具有挑战性的约束条件下.
主要方法:
- 提出了一个事件触发式培训和时间触发式执行 (ETTE) 框架,将互动重新构成一个事件触发式马尔科夫决策过程 (ETMDP).
- 只有在满足特定环境条件时,代理才能更新行动,从而减少训练期间的决策步骤.
- 利用双延迟深确定性政策梯度算法来训练ETDRL指导法.
主要成果:
- 通过减少决策步骤的数量,显著加快了政策培训.
- 通过训练有素的政策的时间触发执行来维持或改善控制性能.
- 与标准DRL算法相比,证明了更高的训练效率.
结论:
- 拟议的ETDRL指导法提供了提高训练效率和优越的拦截性能.
- 该ETDRL方法有效地解决了拦截高速机动目标的挑战,其机动性有限,仅测量轴承.
- ETTE框架为需要高效有效的指导系统的现实应用提供了可行的解决方案.


