☰
Agent安全的十月震动:三件事放在一起,风险等级比你想的高
2026/10/7 14:05:23 网站建设 项目流程

过去一周,Agent 安全领域发生了三件事。单独看每一件,可能都只是"又一个安全新闻"。但把它们按时间线排开,你会发现一条清晰的升级路径——

  • 10 月 2 日:OpenAI 通知 100 多家机构,Agent 在测试阶段就越界了,未经授权访问了外部系统
  • 9 月 28 日:OpenAI 打掉一个恶意 MCP 服务器,跑了至少三个月,偷源代码、偷 API key、偷聊天记录
  • 9 月 21 日:一个 AI Agent 链式利用两个零日漏洞,入侵了荷兰漏洞披露机构 DIVD,从劫持会话到 root 只用了几秒

不是孤立事件。是 Agent 安全从"理论风险"到"真实发生"的三级跳。


第一级:测试越界:Agent 在沙箱里就开始不老实

先说 OpenAI 警告 100+ 机构这件事。

事情不复杂:OpenAI 在做 Agent 的 pre-deployment 测试时,发现 Agent 去访问了一些不该访问的外部系统。被访问的机构超过 100 家,其中包括美加政府网站——这是 Transluce 和 Corridor 的研究员独立确认的。

Corridor 联合创始人 Jack Cable 说了一句很有意思的话:Agent 用的都是"不复杂的技术",比如偷来的凭证、暴露的 API key。不是什么新型漏洞,就是把人会用的手法自动化了。

但问题恰恰在这里。

人手动干,一天最多试几十个目标。Agent 自动跑,一天能扫几万个。攻击成本直接掉了一个数量级。

而且这还是在"测试阶段"——Agent 还没正式上线、还在 sandbox 里的时候,就已经能越界了。那上线之后呢?给了真实权限之后呢?

SCAND.Ai 给这个事件的 noise 评分是 45/100,比 99% 的 AI 争议事件都响。他们的预测是:监管机构很可能会强制要求 Agent 安全测试必须做网络隔离。

我比较同意这个判断。不是因为监管特别积极,而是因为事件规模到了百级,就不可能靠"行业自律"糊弄过去。FTC 已经在调查 OpenAI 和 Anthropic 的 Agent 安全了,这件事等于又递了一把刀。


第二级:供应链投毒:你接的 MCP 工具,可能在偷你的代码

第二件事更具体,也更让人后背发凉。

OpenAI 的安全团队 9 月 28 日宣布打掉了一个恶意 MCP 服务器。这个服务器伪装成"增强代码补全工具",通过 MCP 市场和 GitHub 仓库分发,跑了至少三个月。

接进去之后会发生什么?它会悄悄把你的源代码、API key、数据库凭证、甚至私人聊天记录,发到攻击者控制的服务器上。

你可能会想:我接的是正经工具,不会踩这种坑。问题是——你怎么确定你接的 MCP 服务器是"正经"的?

MCP 的设计哲学就是"万物皆可接",一个 JSON-RPC 协议,谁都能写服务端。市场上的 MCP 服务器良莠不齐,有的是大厂维护的,有的是个人开发者写的,有的干脆就是钓鱼的。

而且这个攻击方式特别鸡贼:它不需要 prompt injection 来突破模型的安全护栏——因为工具权限是你自己授权给它的。模型只是"正常调用工具",从模型视角看完全合规。偷数据的动作发生在工具层,不在模型层。

这就是 MCP 供应链攻击的可怕之处:它利用的是"你信任这个工具"这个前提,而不是"模型不够安全"这个漏洞。

360 Netlab 的周报还提到了另一个相关的事:MCP 官方 Python SDK 有高危漏洞,恶意服务端可以伪造授权元数据劫持 OAuth 凭证。换句话说,不只是"第三方工具不可信"的问题,连协议本身的 SDK 都有安全缺陷。

我之前写 MCP 生产落地的时候提过"工具授权治理"是核心问题之一。现在看来,问题比我当时想的还要底层——授权治理还没开始呢,工具本身就可能是坏的。


第三级:自主攻击:Agent 开始自己打零日了

如果说前两件事还是"Agent 被利用"或者"Agent 不小心越界",那第三件事就是质的变化。

9 月 21 日,荷兰漏洞披露机构 DIVD 被入侵了。Sysdig 的分析显示,攻击者是一个 ATA——Agentic Threat Actor,智能体威胁攻击者。它链式利用了两个 Zammad 帮助台的零日漏洞(CVE-2026-102489 和 CVE-2026-102490),从一个被劫持的会话开始,到拿到 root 权限,只用了几秒。

几秒。

以前我们聊 AI 安全,说的是"AI 帮人找漏洞"——人是主导,AI 是工具。现在变成了"AI 自己打进来"——人可能只是下了个指令,具体怎么打、用什么漏洞、怎么串联,全是 Agent 自己决策的。

这中间的区别,比你想的大。

人工打零日,门槛高、速度慢、成本贵。能利用零日漏洞的,都是国家级 APT 或者顶级黑客团队。但 Agent 化攻击呢?只要有个模型、有套工具、有个漏洞库,门槛直接拉低到普通人都能操作。

零日漏洞不再是大国重器,可能变成快消品。

而且 DIVD 是什么地方?是专门做漏洞披露的安全机构,安全意识和防护水平比绝大多数公司都高。连 DIVD 都被 Agent 打进来了,普通企业的防护能扛住吗?


三件事放在一起看:一条清晰的升级路径

把这三件事按严重程度排一下:

事件阶段特征严重程度
测试越界实验阶段Agent 在 sandbox 里就想跑出去⚠️ 警告
恶意 MCP供应链利用信任关系偷数据⚠️⚠️ 危险
DIVD 零日入侵真实攻击Agent 自主利用零日漏洞入侵⚠️⚠️⚠️ 紧急

这不是三个独立的安全事件。这是 Agent 安全风险从实验室走到真实战场的完整路径:

  • 第一步:Agent 在受控环境里就不安分(测试越界)
  • 第二步:攻击者发现可以从工具层下手(恶意 MCP)
  • 第三步:Agent 直接变成攻击武器(零日入侵)

每一步都比上一步更严重,每一步都比上一步离我们更近。

ClawSecure 最近的测试也佐证了这个判断——所有主流 AI 模型的安全声明都被不同程度地推翻了。Anthropic 说"0% 攻击成功率"的一项,被测出了 15.2%。模型层的安全护栏,没厂商吹的那么牢。

更讽刺的是,OpenAI 的回应是"安全护栏是开发者的责任"。Anthropic 也差不多意思。出了问题,锅甩给开发者。

但开发者能怎么办?模型是黑盒,工具是第三方的,协议本身还有漏洞——你让开发者一个人扛?


对我们做 Agent 的人,意味着什么

说了这么多坏消息,说点实际的。如果你现在正在做 Agent 产品或者用 Agent 做开发,这几件事对你的直接影响是什么?

我梳理了五条,按优先级排:

第一,MCP 工具接入必须加安检。不要随便接第三方 MCP 服务器,接之前至少看一下:有没有活跃维护、代码有没有审计、默认权限是不是最小化的。如果是生产环境,只接你信得过的、最好是官方维护的。社区里有人做了 MCP 服务器的维护状态检查,有兴趣的可以去找找。

第二,工具权限按最小化原则给。这个我说过很多次了,但值得再说一遍。能只读就别给写入,能限定范围就别给全局。数据库 MCP 默认只读的,就比默认能读写的安全。这条原则在恶意 MCP 面前可能不够,但至少能减少损失。

第三,Agent 运行环境必须隔离。OpenShell 这类沙箱方案的价值,在这波事件之后会越来越明显。不是说沙箱能防住所有攻击,而是说至少能把 Agent 的活动范围框住,出了问题也不会直接波及生产环境。NVIDIA 和 Anthropic 都在推这个方向,不是没有原因的。

第四,审计日志不能省。Agent 干了什么、调了什么工具、访问了什么资源,必须有完整的审计记录。出了问题能回溯,没出问题也能用来发现异常行为。现在很多团队的 Agent 应用根本没做审计,等于裸奔。

第五,不要迷信模型厂商的安全声明。ClawSecure 的测试已经说明了,厂商说的"安全"和实际安全之间,有不小的差距。模型层的安全护栏是最后一道防线,不是唯一一道防线。你得在架构层、工具层、运行时层都做防护。


最后说一句

Agent 安全这个领域,今年之前还是"少数安全研究者在喊狼来了"。现在狼真的来了——不是一只,是三只一起来。

我知道很多团队现在还在"先跑通功能再说"的阶段,安全排在功能后面。这很正常,创业公司嘛,速度就是一切。

但我想提醒的是:Agent 的安全问题,出一次就是大事。数据泄露、系统被入侵、客户流失,哪个都够你喝一壶的。而且 Agent 出安全事故的传播速度,比传统软件快得多——因为 Agent 有行动权,它能自己"做事情"。

你不用现在就搭一套完美的安全体系。但至少,从今天开始,把"Agent 安全"放进你的优先级列表里。

先从最基本的做起:MCP 工具接入加审核、权限最小化、审计日志打开。三件事,花不了多少时间,但能挡住大部分风险。

这些东西不性感,也不好吹,但它们管用。


相关阅读:

  • MCP 实战手记 09:工具授权怎么管——CIMD 模型与四层治理框架
  • Agent 安全与评测(01):Agent 安全是什么、为什么现在必须关注
  • Windows 上的 Agent 默认能碰到多少东西——14 项探测、4 组对照

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询