RCM:一个带有重建机制的神经政策模型,用于构建敏捷卫星调度问题的解决方案
IEEE transactions on cybernetics
|March 3, 2025
概括
一个新的重建模型 (RCM) 改进了灵活的地球观测卫星调度 (AEOSSP) 的深度强化学习 (DRL). RCM提高了决策准确性和解决方案质量,以最小的计算超越现有方法.
科学领域:
- 运营研究 运营研究
- 人工智能的人工智能
- 航空航天工程 航空航天工程
背景情况:
- 敏捷的地球观测卫星调度问题 (AEOSSP) 是一个复杂的组合优化挑战.
- 现有的针对NP-hard问题量身定制的方法是计算密集型和实例敏感的.
- 深度强化学习 (DRL) 是有希望的,但可能会遭受导致资源浪费的决策错误.
研究的目的:
- 为AEOSSP开发一种增强的深度强化学习方法.
- 提高卫星调度中的决策准确性和解决方案质量.
- 为了减少AEOSSP中的计算开销和资源浪费.
主要方法:
- 提出了一种新的重建模型 (RCM),一种基于DRL的两阶段方法.
- RCM集成了一个用于初始解决方案生成的构建模型 (CM) 和一个用于改进的重构机制 (RM).
- 在"维修-移除-修复"过程中,RM使用"维修"和"移除"操作员来纠正CM的决策错误.
主要成果:
- 拟议的RCM显著优于最先进的AEOSSP代搜索方法.
- 在0.1秒的非常短的计算时间内,RCM实现了卓越的性能.
- 集成的CM超越了现有的最先进的DRL政策模型,RM有效地纠正错误.
结论:
- RCM是一个有效的模块化组件,用于提高AEOSSP中的DRL结果.
- 通过解决DRL决策的不准确性,RCM提高了解决方案的稳定性和质量.
- 这种方法为复杂的卫星调度问题提供了计算效率高和高性能解决方案.


