国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:符小卫, 王辛夷, 乔哲
单位:西北工业大学电子信息学院, 陕西 西安 710129
关键词:多无人机,强化学习,值分解网络,注意力机制,机动决策
在多无人机(unmanned aerial vehicles, UAVs)对抗环境中, 由于UAV的数量较大, 使用常规深度强化学习方法处理此类问题时可能存在值函数维度爆炸、策略网络难收敛等问题。对此, 提出一种基于值分解思想与注意力机制的策略交互Q学习(attention policy interaction Q-learning, APIQ)集群对抗算法, 引入值分解思想, 缓解了值函数维度爆炸的问题, 并基于注意力机制对值分解中的各值进行权重分配, 促进了策略网络的收敛。为验证APIQ算法在多UAV对抗问题中的可行性, 建立较为真实的环境模型, 并通过仿真验证了该算法的可行性。与其他算法对比结果表明, APIQ算法控制下的UAV具有更高的对抗胜率。
来源:2025年第7期
《系统工程与电子技术》期刊编辑部