国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:朱霸坤, 朱卫纲, 李伟, 杨莹, 高天昊
单位:1. 航天工程大学电子光学工程系, 北京 101416;2. 电子信息系统复杂电磁环境效应国家重点实验室, 河南 洛阳 471032;3. 航天工程大学研究生院, 北京 101416
关键词:雷达对抗,马尔可夫决策过程,强化学习,收益塑造,先验知识
基金:电子信息系统复杂电磁环境效应国家重点实验室项目(CEMEE2020Z0203B)
针对基于强化学习的多功能雷达干扰决策方法训练周期长、收敛慢的问题,本文提出了基于先验知识的多功能雷达智能干扰决策算法。所提算法使用了基于势能函数的收益塑造理论,利用先验知识设置收益函数,相比于传统算法,具有更快的收敛速率。利用先验知识加速算法收敛速率的方法对强化学习在多功能雷达干扰决策中的实际应用具有重要的意义,对于强化学习在其他领域的应用也具有很好的参考价值。
来源:2022年第12期
《系统工程与电子技术》期刊编辑部