系统工程与电子技术

北大核心,INSPEC,JST,EI,CSCD

国内刊号:11-2422/TN

国际刊号:1001-506X

系统工程与电子技术杂志2022年第3期:强化学习中的策略重用: 研究进展

发布日期:

作者:何立, 沈亮, 李辉, 王壮, 唐文泉

单位:1. 四川大学计算机(软件)学院, 四川 成都 610065;2. 四川大学视觉合成图形图像技术国家级重点实验室, 四川 成都 610065;3. 江西洪都航空工业集团有限责任公司, 江西 南昌 330024

关键词:强化学习,迁移学习,策略重用,任务映射

基金:”十三五”全军共用信息系统装备预研项目(31505550302)

策略重用(policy reuse, PR)作为一种迁移学习(transfer learning, TL)方法, 通过利用任务之间的内在联系, 将过去学习到的经验、知识用于加速学习当前的目标任务, 不仅能够在很大程度上解决传统强化学习(reinforcement learning, RL)收敛速度慢、资源消耗大等问题, 而且避免了在相似问题上难以复用的问题。本文综述了RL中的PR方法, 将现有方法细分为策略重构、奖励设计、问题转换、相似性度量等方面来分别介绍和分析各自的特点, 及其在多智能体场景和深度RL(deep RL, DRL)中的扩展。并且, 介绍了源和目标任务之间的映射方法。最后, 基于当前PR的应用, 叙述了该课题在未来发展方向上的一些猜想和假设。

来源:2022年第3期

《系统工程与电子技术》期刊编辑部

查看系统工程与电子技术杂志2022年第3期

联系我们

  • 地址:北京市142信箱32分箱
  • 电话:(010)68388406/68386014
  • E-mail:E-mail:xtgcydzjs@126.com

咨询工作人员