☰
Policy Disruption in Reinforcement Learning:Adversarial Attack with Large Language Models and Cri...
2026/10/10 8:50:17 网站建设 项目流程

文章主要内容总结

本文聚焦强化学习(RL)系统的对抗性攻击问题,针对现有攻击方法需修改环境或策略、实用性有限的缺陷,提出了一种名为ARCS(Adversarial Rewards and Critical State Identification)的自适应对抗框架。该框架无需改变环境,通过现有代理引导目标策略输出次优动作,从而破坏其性能。

ARCS包含两个核心模块:

  • 奖励迭代优化模块:利用大型语言模型(LLMs)生成针对目标代理漏洞的定制化对抗性奖励函数,通过迭代优化增强引导目标代理做出次优决策的效果。
  • 关键状态识别机制:定位目标代理最脆弱的状态(即次优行为会导致整体性能显著下降的状态),并在攻击者训练中注入额外奖励,引导其聚焦于这些高影响状态。

实验在多个环境(如MuJoCo的Sumo-Human、Kick-and-Defend,以及自动驾驶场景)中进行,结果表明ARCS在攻击成功率上显著优于现有方法,验证了其有效性。

创新点

  1. 提出基于LLMs的奖励迭代优化框架,能自适应生成针对目标代理漏洞的对抗性奖励函数,为对抗性策略训练提供定向引导。
  2. 设计关键状态识别机制,精准定位目标代理的高影响脆弱状态,通过引导攻击者聚焦这些状态提升攻击效率。
  3. 构建ARCS新型对抗攻击框架,无需修改环境或访问目标代理内部信息,仅通过现有代理的交互即可引导目标策略产生次优行为,且在多环境实验中验证了其优越性。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询