国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:万齐天, 卢宝刚, 赵雅心, 温求遒
单位:1. 北京理工大学宇航学院, 北京 100081;2. 北京航天长征飞行器研究所, 北京 100076;3. 中国运载火箭技术研究院, 北京 100076
关键词:强化学习,自动驾驶仪,参数整定,智能控制,归一化
基金:航空科学基金(202037012003)
针对深度强化学习方法对驾驶仪控制参数训练速度慢、奖励函数收敛性不好等问题, 以三回路驾驶仪极点配置算法为核心, 提出一种将三维控制参数转换为一维设计参量的智能训练方法, 构建离线深度强化学习训练叠加在线多层感知器神经网络实时计算的智能控制架构, 在提高深度强化学习算法的效率和奖励函数收敛性同时, 确保在大范围飞行状态变化条件下控制参数的快速在线自整定。以典型再入飞行器为例, 完成深度强化学习训练和神经网络部署。仿真结果表明,强化学习动作空间简化后的训练效率更高, 训练得到的驾驶仪对控制指令的跟踪误差在1.2%以内。
来源:2022年第10期
《系统工程与电子技术》期刊编辑部