国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:熊威, 张栋, 任智, 杨书恒
单位:1. 西北工业大学航天学院, 陕西 西安 710072;2. 陕西省空天飞行器设计重点实验室, 陕西 西安 710072
关键词:有人/无人机协同,空战机动决策,深度强化学习,忠诚僚机
基金:国家自然科学基金(52472417);群体协同与自主实验室开放基金(QXZ23013402)
有人/无人机协同是目前无人机空战发展的趋势, 智能决策是实现有人机与无人机协同打击的关键。高动态战场环境、非对称作战任务和异构多源协同体系, 导致无人机自主能力和实时性较差, 策略训练困难, 是有人/无人机协同打击研究的难点。基于有人/无人机协同的忠诚僚机方案, 设计典型的有人/无人机协同打击样式, 提出一种基于改进多智能体双延迟深度确定性(multi-agent twin delayed deep deterministic, MATD3)策略梯度算法的强化学习方法。首先, 设计基于MATD3策略梯度算法、课程学习(curriculum learning, CL)的协同机动决策训练框架和基于迁移学习的预训练(pre-train, PT)策略, 解决有人/无人机协同打击策略训练困难的问题。其次, 建立面向有人/无人机协同机动的多机协同奖励函数和状态空间。最后, 结合设计的搭载六自由度仿真模型的数字仿真推演平台, 验证训练得到的打击策略具有高效的打击和生存能力, 能够指导未来有人/无人机协同打击作战的实际应用。
来源:2025年第4期
《系统工程与电子技术》期刊编辑部