国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:张耀中*, 吴卓然, 张建东, 杨啟明, 史国庆, 徐自祥
单位:1. 西北工业大学电子信息学院,西安 陕西 710072;2. 中国科学院天津工业生物技术研究所,天津 300308
关键词:博弈论,深度强化学习,追逃博弈,无人机,多智能体
基金:陕西省重点研发计划(2022GY-089);陕西省自然科学基础研究计划(2022JQ-593)资助课题
针对无人机(unmanned aerial vehicle,UAV)多对一追逃博弈问题,以强化学习的深度确定性策略梯度算法(deep deterministic policy gradient, DDPG)为基础,结合追逃问题的微分博弈对抗数值求解结果,提出一种混合经验的DDPG(mixed experienced DDPG,ME-DDPG)算法。在探索学习的策略集中加入博弈对抗数值解,计算出指向性策略,提升UAV追击策略的训练效率,改善UAV追逃博弈问题中由于回合任务过长、回报奖励稀疏、强化学习算法探索不足而导致的算法收敛速度缓慢且容易局部收敛的问题,提高了强化学习算法的学习效率。仿真实验结果表明,使用ME-DDPG算法解决UAV多对一博弈追逃任务时能够快速收敛,任务成功率达到83%。对比实验验证了所提算法相较DDPG算法在收敛性、稳定性以及任务成功率方面的优势。
来源:2025年第10期
《系统工程与电子技术》期刊编辑部