国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:王子怡, 傅雄军, 董健, 冯程
单位:北京理工大学集成电路与电子学院, 北京 100081
关键词:雷达抗干扰策略,分层强化学习,多智能体系统,深度确定性策略梯度,稀疏奖励
雷达协同抗干扰决策过程中奖励存在稀疏性,导致强化学习算法难以收敛,协同训练困难。为解决该问题, 提出一种分层多智能体深度确定性策略梯度(hierarchical multi-agent deep deterministic policy gradient, H-MADDPG)算法, 通过稀疏奖励的累积提升训练过程的收敛性能, 引入哈佛结构思想分别存储多智能体的训练经验以消除经验回放混乱问题。在2部和4部雷达组网仿真中, 在某种强干扰条件下, 雷达探测成功率比多智能体深度确定性梯度(multi-agent deep deterministic policy gradient, MADDPG)算法分别提高了15%和30%。
来源:2025年第4期
《系统工程与电子技术》期刊编辑部