一个基于强化学习的3D分布算法估计,用于模糊分布式混合流量商店调度,考虑按时交付
IEEE transactions on cybernetics
|December 21, 2023
概括
本研究介绍了一种用于模糊分布式混合流量商店调度的新算法,以优化能源和交付时间. 配送算法的3D估计与强化学习有效平衡生产效率和客户满意度.
科学领域:
- 运营研究 运营研究
- 制造业 工程 制造工程
- 人工智能的人工智能
背景情况:
- 对大规模定制和全球竞争的日益增长的需求需要高效,环保的分布式制造.
- 调度的不确定性是智能制造的关键因素,但考虑到能源和客户满意度的不确定分布式调度的研究是有限的.
- 与按时交付 (FDHFSP-OTD) 相关的模糊分布式混合流量商店调度问题是一个复杂的挑战.
研究的目的:
- 解决模糊分布式混合流量商店调度问题,考虑按时交付 (FDHFSP-OTD).
- 开发和评估一个新的3D估计分布算法 (EDA),与强化学习 (RL) 集成,以解决这个问题.
- 在不确定的制造环境中最大限度地提高交付准确度的同时,最大限度地减少制造周期和能源消耗.
主要方法:
- 建议使用基于Q学习的增强学习 (RL) 结合分布算法 (EDA) 的3D估计.
- 初始化采用了合作式启发式和随机方法.
- 后代使用了3D概率矩阵,进化方向通过基于Q学习的偏向解码方法进行了自适应调整.
- 纳入了当地强化战略,以增强精英解决方案.
主要成果:
- 广泛的实验分析了参数效应,并确定了最佳值组合.
- 数字结果验证了拟议的战略和方法的有效性.
- 与现有算法相比,3D-EDA/RL方法在解决FDHFSP-OTD问题方面显示出显著的潜力.
结论:
- 与RL一起开发的3D EDA对于考虑按时交付的模糊分布式混合流量商店调度问题是有效的.
- 综合方法成功地平衡了将制造商和能源消耗降至最低的目标,并最大限度地提高了交付准确性.
- 该研究强调了先进的人工智能技术在解决复杂,不确定的制造计划挑战方面的潜力.
相关概念视频
Reinforcement Schedules
148
Positive reinforcement is a powerful method for teaching new behaviors to both animals and humans. B.F. Skinner demonstrated this with his experiments using rats in a Skinner box. When a rat pressed a lever, it received a food pellet. This immediate reward encouraged the rat to repeat the behavior. This method, where a reward follows every instance of the behavior, is known as continuous reinforcement. It is highly effective for establishing new behaviors quickly.
Once a behavior is learned,...
Once a behavior is learned,...
148
Rapidly Varying Flow
63
Rapidly varying flow (RVF) in open channels is characterized by abrupt changes in flow depth over a short distance, with the rate of depth change relative to distance often approaching unity. These flows are inherently complex due to their transient and multi-dimensional nature, making exact analysis difficult. However, approximate solutions using simplified models provide valuable insights into their behavior.Key Features of Rapidly Varying FlowRVF is commonly observed in scenarios involving...
63


