国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:唐恒, 孙伟, 吕磊, 贺若飞, 吴建军, 孙昌浩, 孙田野
单位:1. 西安电子科技大学空间科学与技术学院, 陕西 西安 710118;2. 西北工业大学第365研究所, 陕西 西安 710072;3. 西安爱生无人机技术有限公司, 陕西 西安 710065;4. 中国空间技术研究院钱学森空间技术实验室, 北京 100094
关键词:强化学习,奖励函数,无人机,动态编队,路径规划
基金:中国高校产学研创新基金(2021ZYA08004);西安市科技计划(2022JH-RGZN-0039);陕西省重点研发计划重点产业创新链项目(2022ZDLGY03-01);国家自然科学基金(62173330)
针对未知动态环境下无人机(unmanned aerial vehicle, UAV)编队路径规划问题, 提出融合动态编队奖励函数的多智能体双延迟深度确定性策略梯度(multi-agent twin delayed deep deterministic strategy gradient algorithm incorporating dynamic formation reward function, MATD3-IDFRF)算法的UAV编队智能决策方案。首先, 针对无障碍物环境, 拓展稀疏性奖励函数。然后, 深入分析UAV编队路径规划中重点关注的动态编队问题, 即UAV编队以稳定的结构飞行并根据周围环境微调队形, 其本质为每两架UAV间距保持相对稳定, 同时也依据外界环境而微调。为此, 设计基于每两台UAV之间最佳间距和当前间距的奖励函数, 在此基础上提出动态编队奖励函数, 并结合多智能体双延迟深度确定性(multi-agent twin delayed deep deterministic, MATD3)算法提出MATD3-IDFRF算法。最后, 设计对比实验, 在复合障碍物环境中, 所提动态编队奖励函数能将算法成功率提升6.8%, 将收敛后的奖励平均值提升2.3%, 将编队变形率降低97%。
来源:2024年第10期
《系统工程与电子技术》期刊编辑部