国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:孟泠宇, 郭秉礼, 杨雯, 张欣伟, 赵柞青, 黄善国
单位:1. 北京邮电大学电子工程学院, 北京 100876;2. 信息光子学与光通信国家重点实验室, 北京 100876
关键词:深度强化学习,路由优化,深度确定性策略梯度算法
基金:国家自然科学基金(61771074);国家重点研发计划(2018YFB1801702)
针对同一网络拓扑下不同网络负载的路由优化问题, 在深度强化学习方法的基础上, 提出了两种依据当前网络流量状态进行路由分配的优化方法。通过网络仿真系统与深度强化学习模型的迭代交互, 实现了对于流量关系分布的网络路由持续训练与优化。在利用深度确定性策略梯度(deep deterministec policy gradient, DDPG)算法解决路由优化问题上进行了提升和改进, 使得该优化方法更适合解决网络路由优化的问题。同时, 设计了一种全新的链路权重构造策略, 利用网络流量构造出用于神经网络输入状态元素, 通过对原始数据的预处理加强了神经网络的学习效率, 大大提升了训练模型的稳定性。并针对高纬度大规模网络的连续动作空间进行了动作空间离散化处理, 有效降低了其动作空间的复杂度, 加快了模型收敛速度。实验结果表明, 所提优化方法可以适应不断变化的流量和链路状态, 增强模型训练的稳定性并提升网络性能。
来源:2022年第7期
《系统工程与电子技术》期刊编辑部