国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:吴冯国, 陶伟, 李辉, 张建伟, 郑成辰
单位:1. 四川大学视觉合成图形图像技术国防重点学科实验室, 四川 成都 610065;2. 中国舰船研究设计中心, 湖北 武汉 430064;3. 四川大学计算机学院, 四川 成都 610065
关键词:深度强化学习,无人机,单元状态序列,门控循环单元
为提升无人机在复杂空战场景中的存活率, 基于公开无人机空战博弈仿真平台, 使用强化学习方法生成机动策略, 以深度双Q网络(double deep Q-network, DDQN)和深度确定性策略梯度(deep deterministic policy gradient, DDPG)算法为基础, 提出单元状态序列(unit state sequence, USS), 并采用门控循环单元(gated recurrent unit, GRU)融合USS中的态势特征, 增加复杂空战场景下的状态特征识别能力和算法收敛能力。实验结果表明, 智能体在面对采用标准比例导引算法的导弹攻击时, 取得了98%的规避导弹存活率, 使无人机在多发导弹同时攻击的复杂场景中, 也能够取得88%的存活率, 对比传统的简单机动模式, 无人机的存活率大幅提高。
来源:2023年第6期
《系统工程与电子技术》期刊编辑部