国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:杨志鹏, 陈子浩, 曾长, 林松, 毛金娣, 张凯
单位:湖北航天技术研究院总体设计所, 湖北 武汉 430040
关键词:在线航路规划,深度强化学习,自主决策,课程学习,威胁规避
基金:国家自然科学基金(62003267)
针对飞行器在线航路规划问题, 提出一种基于深度强化学习(deep reinforcement learning, DRL)的飞行器在线自主决策方法。首先对飞行器运动模型、探测模型进行了说明, 然后采用DRL深度确定性策略梯度(deep deterministic policy gradient, DDPG)算法, 对飞行器飞行控制策略模型框架进行了构建。在此基础上, 提出了一种基于课程学习(curriculum learning, CL) 的CL-DDPG算法, 将在线航路规划任务进行分解, 引导飞行器进行目标靠近、威胁规避、航路寻优策略学习, 并设置相应的高斯噪声帮助飞行器对策略进行探索和优化, 实现了复杂场景下的飞行器自适应学习和决策控制。仿真实验证明, CL-DDPG算法能够有效提升模型的训练效率, 算法模型任务成功率更高, 具有优秀的泛化性和鲁棒性, 能够更好地应用于复杂动态环境下的在线航路规划任务中。
来源:2024年第9期
《系统工程与电子技术》期刊编辑部