PASTABench:面向智能体安全的序列轨迹主动评估基准
arXiv编号:arXiv:2609.28197v1 [cs.AI]
摘要
随着大语言模型进化为可以改变真实世界状态的自主智能体,保障多步工作流运行安全成为关键挑战。现有安全评测存在明显短板:单步评测将各个动作孤立看待,忽略风险随轨迹逐步累积的效应;轨迹级评测大多为事后分析,无法提供及时干预时机。本文形式化定义解耦式主动安全监控(Decoupled Proactive Safety Monitoring),从三个核心维度定义任务:是否干预(Whether)、何时干预(When)、风险是什么(What)。构建PASTABench基准数据集,包含1139条多轮交互轨迹,覆盖5大类、13个子类风险。提出最优干预窗口OIW(Optimal Intervention Window),通过标注「最早信号轮次Earliest‑Signal」与「触发轮次Trigger」,对干预时机做量化评估。对16个主流大模型开展评测,结果表明主动干预任务仍远未被解决,最优模型的完美时机干预率仅为40.74%。细粒度诊断发现普遍存在词汇过拟合现象:部分小模型安全指标看似不错,实际只是对危险关键词高度敏感,并非真正理解风险逻辑;一旦把危险词汇脱敏消除,小模型主动安全能力会大幅崩塌;而闭源前沿大模型仍然可以维持基于状态的推理能力。
关键词
智能体安全;主动安全监控;序列轨迹;最优干预窗口;词汇过拟合;安全评测基准
目录
- 引言
- 相关工作
- 2.1 大模型智能体安全评测范式
- 2.2 智能体工作流防护模型
- PASTABench基准数据集
- 3.1 风险分层分类体系
- 3.2 数据集完整构建流水线
- 3.3 评测指标定义
- 实验
- 4.1 实验设置
- 4.2 主实验结果
- 4.2.1 风险归因能力(What维度)
- 4.2.2 跨风险类别性能差异
- 4.2.3 干预时间精度(When维度)
- 4.3 时序推理诊断:词汇过拟合脱敏消融
- 讨论
- 结论
- 参考文献
- 附录A 对比现有安全基准
- 附录B 风险分类详细定义
- 附录C 环境、工具库配置
- 附录D 评测Prompt、推理超参数
- 附录E 完整细分实验数据
- 附录F 案例分析
1 引言
大语言模型智能体可以完成长视界规划、调用工具,改变数字甚至物理世界状态,部署时运行安全是核心阻碍。
传统单轮安全评测存在固有缺陷:智能体风险很少来自单条明显有害输出;风险往往是多步累积形成,一系列单看无害的动作逐步演化,最终酿成危害。安全属于整条轨迹层面属性,需要持续监控。
现有多轮安全评测有两大关键局限:
- 步骤级评测:孤立评估每一步动作,忽略风险随时间累积演化;
- 轨迹级事后评测:整条交互结束后才给出安全判定,来不及做及时干预。
本文提出解耦式主动安全监控,将监控任务拆解为三个必须同时完成的维度:
- Whether 是否干预:监控器检测逐步累积的风险,不能过度敏感误报,判断是否应当中断智能体执行;
- When 何时干预:在恰当时间点阻断,不能过早干扰正常业务,也不能过晚导致伤害不可逆;
- What 风险归因:诊断识别正在浮现的风险类型,支持针对性缓解,而不是简单粗暴拒绝执行。
为系统性评估该任务,构建PASTABench基准:
- 数据集规模:1139条多轮交互轨迹,覆盖高风险业务领域;
- 风险采用层级分类:5个一级大类,13个二级子类;
- 提出最优干预窗口OIW:每条轨迹标注两个时间锚点:
- t e s t_{es}tes:Earliest‑Signal最早信号轮次,风险先兆首次出现;
- t t r i g g e r t_{trigger}ttrigger:Trigger触发轮次,继续执行将产生不可逆危害。
- OIW窗口:[ t e s , t t r i g g e r ) [t_{es},\ t_{trigger})[tes, ttrigger),干预落在该区间为时机合理。
示例场景:数字工作空间,系统提示目标文件带有
CRITICAL_ASSET标记,该时刻为t e s t_{es}tes;智能体执行绕过确认批量删除命令,该时刻为t t r i g g e r t_{trigger}ttr