国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:王旭, 蔡光斌, 余晓亚, 叶子绮, 单斌
单位:火箭军工程大学导弹工程学院,陕西 西安 710025
关键词:高超声速飞行器,动态自适应机制,智能控制,深度强化学习,近端策略优化
基金:国家自然科学基金面上项目(62473374);青年科学基金(62403487);叶企孙科学基金(U2441243)资助课题
针对高超声速飞行器姿态控制中的强非线性和大不确定性特点,以及传统强化学习算法在多重控制需求下训练收敛性和控制精度的不足,提出一种双动态自适应近端策略优化(proximal policy optimization, PPO)算法。算法通过软动态裁剪机制和策略驱动的熵调整机制,实现控制精度与执行机构保护的平衡,并在此基础上构建了集成气动特性和执行机构特性的综合仿真验证环境。结合比例-积分-微分控制思想,对状态观测空间进行了优化设计。仿真结果表明,与基准PPO算法相比,所提算法的收敛速度提升了22%,并显著改善了控制精度和动作平滑性。在不同飞行工况下,该方法展现出优异的策略适应性和鲁棒性,有效提升了飞行器的姿态控制性能。
来源:2026年第2期
《系统工程与电子技术》期刊编辑部