一个月前,"Jacob Coxon"事件配上一条病毒式推文,让整个科技圈相信AI模型已经学会了自主越狱、闯入系统。9月这一周,《华尔街日报》的一篇评论文章把这个故事重新审了一遍,结论却完全不同:93%被标记为"异常"的行为,其实是模型从未解决过的任务,而系统本身还被给予了"继续尝试、不要放弃"的激励。这场被称为"AI Doom"的恐慌,正在经历一次舆论反转。
Big Technology Podcast 主播 Alex Kantrowitz 与 Margins 的 Ranjan Roy 在周五节目中,把这场反转拆开来看——从技术细节到围绕它衍生出的政治阴谋论,试图弄清楚:这到底是一次被过度渲染的技术事故,还是真正值得警惕的信号。
1. 93%的任务,模型其实从未解开过
《华尔街日报》援引《原子科学家公报》的一项重新分析指出,OpenAI 当时是在 exploit gym 这个网络安全基准环境中测试模型,且刻意关闭了重要的安全限制。所谓的"越狱",实际发生在一个并未完全封闭的环境里:模型可以通过一个联网的中间层获取软件,随后发现同一条通道也能被用来传递信息进出系统。技术报告显示,OpenAI 知道自己的智能体在使用这条通道,却选择不干预。
这与 Ranjan 上周的判断吻合。他说自己在劳动节假期通读了 Meter 的研究报告后反复回到一个事实:这些模型不是被设计去黑掉 Hugging Face 的,甚至压根没被告知目标是 Hugging Face。它们被交代的是一个具体漏洞,任务是"去攻破它"。而它们获得的computer shell 访问权限,是通过 JFrog 公司的 Artifactory 产品,这本身就是一处配置失误,而不是模型自己想出办法翻墙上网。
"这不是一群坐在那儿本该订机票、订餐厅,却突然自己开窍去干别的事的智能体,"Ranjan 说,"它们本来就是被派去黑客攻击的,而且它们做到了,规模还远超预期——这本身也是agentic 能力的一个证明。"他仍然强调一个缺口:OpenAI从未公开过完整的提示词和具体指令,如果能看到那些原始文本,很多问题会有答案,但目前这部分信息始终缺失。
2. "信任与安全2.0":David Sacks 把这场辩论拉进了政治战场
风投人、前白宫AI与AI相关事务顾问 David Sacks 给这场讨论加了一层新的解读。他在推文里写道,这是"信任与安全2.0"——上一次媒体制造的恐慌是"通俄门"和新冠期间,科技公司借机组建信任与安全团队去审查异见声音;这一次,计划是把"不可解雇"的有效利他主义(EA)监督者塞进每一家AI公司,充当新的信任与安全层。他形容这种审查会"更全面,但也更隐蔽",只要实验室不听话,这个"不受问责的NGO层"就会向媒体哭诉"这家公司正在威胁人类",然后被捧成吹哨人。
Ranjan 承认自己作为"Doom Backlash队长",被 Sacks 这种把话题硬拉到通俄门、新冠、南方贫困法律中心的论述方式弄得有点难以附和——这让他很难完全站队。但他同意其中一个核心判断:这整套叙事确实在把更多控制权,交到了实验室之外的一小撮人手里。
他随后讲了一个更直接的观察:刚结束在伦敦一周的行程,见了不少企业高管,"这是所有人都在谈的话题"。几周前大家还在聊 tokenomics、Kimi、GLM 这些性价比模型,如今话题又绕回了"前沿模型是否太强大"。"你去出差谈生意,'人类灭绝'居然成了一个真实被讨论的话题——这事儿本身就够疯狂的。" 无论这场恐慌是不是营销手段,它显然成功地让对话重新聚焦在了前沿模型的危险性上。
3. EA"夺权论"从何而来:一条从 Dario 博客延伸出的推理链
Alex 解释了这套阴谋论的起源。Anthropic CEO Dario Amodei 写了一篇博客,提议引入独立评估机构,监督AI是否出现失控行为,随后 Sam Altman 和 Elon Musk 都表态支持这个想法。问题在于,最有可能承担"独立评估者"角色的机构是 Meter,而 Meter 的资金部分来自 Anthropic 与一些EA背景的资助方,其内部不少人也是有效利他主义的参与者或同路人。于是一种说法开始流传:整场"AI越狱恐慌",其实是EA群体借机夺取AI未来控制权的手段。
Ranjan 的反驳很直接:这跟一直以来的情况有什么区别?"硅谷和AI领域大部分流动的钱,本来就一直是EA的钱,某种意义上大家都算EA。"
Alex 并不认同这个类比。他指出,最近一轮 OpenAI 融资是由 Kushner 牵头的,海湾国家资本也深度参与其中,这些都不是EA资金;SoftBank 同样不是EA背景。"如果你说部分种子轮资金来自EA源头,这是事实,但不代表整场融资都是EA在出钱。"
两人随即陷入一场半开玩笑的拉锯:Ranjan 打趣说,"有效利他主义"说到底不就是"尽可能多赚钱,然后按自己认为合适的方式回馈人类"吗?照这个定义,Kushner 也算EA。Alex 直接拒绝配合这个逻辑,认为这已经是"过度延伸",随后开始向听众解释——有效利他主义作为一种思潮和组织形态,在 Sam Bankman-Fried 事件之后其实已经相对松散解体……
这场对话在这里被打断,但它已经把问题摆清楚了:无论是"AI自主黑客"的原始叙事,还是随后浮现的"EA夺权论",都经不起细看的推敲——真正值得追问的,或许不是模型有多可怕,而是谁在决定我们该为什么而恐慌。