声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:符小卫, 王辛夷, 乔哲
单位:西北工业大学电子信息学院, 陕西 西安 710129
关键词:多无人机,强化学习,策略梯度,机动决策,注意力机制
在多无人机对抗中, 无人机通信范围内的友方数量不定, 导致其获得的信息量存在变化。而深度强化学习中神经网络的输入维度是固定的, 很多算法只考虑距离较近的固定数量友方无人机的交互信息, 导致信息丢失且不符合实际战场环境。对此, 基于多智能体深度确定性策略梯度(multi-agent deep deterministic policy gradient, MADDPG)算法, 结合注意力机制, 提出注意力状态深度确定性策略梯度(attention state-deep deterministic policy gradient, ASDDPG)算法, 将变化的信息转化为固定长度的特征向量, 解决信息量与输入维度不匹配的问题, 并通过编解码结构进行状态特征提取, 增强无人机的决策能力。通过仿真实验对算法的性能进行对比分析, 验证该算法控制下的无人机具有更高胜率, 且泛化性良好, 在提升无人机对抗决策能力和泛化性方面具备优势。
来源:2025年第6期
《系统工程与电子技术》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。