国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:付可, 陈浩, 王宇, 刘权, 黄健
单位:国防科技大学智能科学学院, 湖南 长沙 410073
关键词:多智能体对抗,贝叶斯策略重用,强化学习,关系表征
针对多智能体对抗中因对手策略变化导致的非平稳性问题, 在对手动作不可获取的限制下, 提出一种基于不确定性的贝叶斯策略重用算法。在离线阶段, 在策略学习的同时, 通过自编码器建模智能体轨迹与对手动作之间的关系表征以构建对手模型。在在线阶段, 依据对手模型和有限交互信息, 估计对手策略类型的不确定性, 并基于此选择最优应对策略并重用。最后, 在两种对抗场景下的实验结果表明所提算法相比3种先进的基线方法识别精度更高, 且识别速度更快。
来源:2025年第2期
《系统工程与电子技术》期刊编辑部