文章主要内容总结
本文聚焦强化学习(RL)系统的对抗性攻击问题,针对现有攻击方法需修改环境或策略、实用性有限的缺陷,提出了一种名为ARCS(Adversarial Rewards and Critical State Identification)的自适应对抗框架。该框架无需改变环境,通过现有代理引导目标策略输出次优动作,从而破坏其性能。
ARCS包含两个核心模块:
- 奖励迭代优化模块:利用大型语言模型(LLMs)生成针对目标代理漏洞的定制化对抗性奖励函数,通过迭代优化增强引导目标代理做出次优决策的效果。
- 关键状态识别机制:定位目标代理最脆弱的状态(即次优行为会导致整体性能显著下降的状态),并在攻击者训练中注入额外奖励,引导其聚焦于这些高影响状态。
实验在多个环境(如MuJoCo的Sumo-Human、Kick-and-Defend,以及自动驾驶场景)中进行,结果表明ARCS在攻击成功率上显著优于现有方法,验证了其有效性。
创新点
- 提出基于LLMs的奖励迭代优化框架,能自适应生成针对目标代理漏洞的对抗性奖励函数,为对抗性策略训练提供定向引导。
- 设计关键状态识别机制,精准定位目标代理的高影响脆弱状态,通过引导攻击者聚焦这些状态提升攻击效率。
- 构建ARCS新型对抗攻击框架,无需修改环境或访问目标代理内部信息,仅通过现有代理的交互即可引导目标策略产生次优行为,且在多环境实验中验证了其优越性。