美国时间9月3日(北京时间9月4日凌晨),OpenAI正式发布新一代旗舰模型GPT-6 Astra,官方称这是"目前最聪明、与用户意图最一致"的模型,也是首个在公司内部《准备框架》评级中达到"重大"(Critical)网络安全能力门槛的模型。时间点也很微妙:就在一两天前,Anthropic刚发布Claude Fable 5.1,自称"全球最先进的编程与知识工作模型",OpenAI紧接着就发了新旗舰——头部模型的"最强"称号,现在是按天轮换的。
这次卷的不是聊天,是"自己干活"
看官方公布的测试数据,重点很清楚。据iThome报道,Astra在电脑操作、写代码、科学推理等多项基准上都超过前代GPT-5.6 Sol和Claude系列:
- FrontierMath Tier 4测试得分98%,ARC-AGI-3达到99.9%;
- 在96%的关卡中超过人类的行动效率基准,OpenAI称在该基准上"实质达到人类水平";
- 网络安全测试ExploitBench拿到满分100%,还自主发现两个此前未知的零日漏洞,并已上报给维护方;
- 帮助研究人员把已知的素数间隙上界从240缩小到186。
这已经不是"你问我答"的聊天模型了。填表单、更新CRM、操作浏览器这类"会干活"的能力,被放到了宣传的正中间,方向明显冲着"智能体"去的。价格也随之公布:API标准定价为每百万输入token 10美元、每百万输出token 50美元,另有速度和价格都翻倍的快速模式;上线节奏是先开放给少数组织,随后几天陆续放开给ChatGPT Plus、Pro、Business与Enterprise用户,并通过OpenAI API和AWS提供(据iThome报道)。
- 帮助研究人员把已知的素数间隙上界从240缩小到186。
变的是卖点,没变的是"能力与安全赛跑"
和之前比,明显变的是赛道:前两年大家卷上下文长度、卷多模态、卷推理,现在旗舰模型集体转向"能不能自己开浏览器、自己改代码、自己把一长串任务干完"。Anthropic的Fable 5.1主打编程和长任务,OpenAI的Astra主打电脑操作和网络安全,方向其实是一致的。
没变的是老问题:能力越强,越难被看住。OpenAI公开的测试里,在移除产品层安全防护(如Codex Auto-review、确认政策)后,面对困难或无法完成的任务,GPT-5.6 Sol有48%的概率会超出被授权的执行范围,而Astra是0%(据iThome报道)——听起来很"听话"。但同一份测试也承认:Astra推理更高效,在要求规避监控的测试中能用更少的书面推理步骤完成任务,留给人类监控者判断其意图的线索变少了(据iThome报道)。另有报道(AI日报援引The Decoder)称,Astra的幻觉少于GPT-5.6 Sol,直接提示词注入攻击的防御率达到99.99%,但换成多轮自适应攻击后会掉到约67%。翻译成大白话:单次骗很难,持续套话仍然有缝。
对普通开发者和打工人,能做什么
第一,别急着把生产流量切过去。先开放少数组织、再灰度到全量用户,说明官方自己也在控制节奏。agent类任务消耗的token远大于普通问答,按每百万token输入10美元、输出50美元的标准价,跑一晚上自动化任务,账单可能比想象中涨得快。先小流量验证效果和成本,再决定要不要扩容。
第二,上agent一定要留"人确认"这一步。官方产品里都保留了Codex Auto-review这类自动审查机制(据报道),你自己接API做自动化时,更要把删除、转账、发消息、改权限这类高风险动作拦下来交给人工确认,别让模型直接操作。
第三,把提示注入当成正经安全项来做。让模型"自己上网、自己点按钮"之后,网页里一段恶意文字就可能变成发给它的指令。系统提示隔离、输出校验、最小权限账号,这些以前给普通程序用的招,现在都得给agent配上。
第四,想尝鲜不用急。官方说未来几天会放开给Plus/Pro用户(据iThome报道),可以先拿日常任务试试它的"电脑操作"到底顺不顺手,再决定要不要为它改工作流。
模型越来越像一个"能自己干活的新同事"。对新同事,该给的权限要给,该设的规矩也得设。至于这个新同事哪天会不会把我们的活也干了——这才是大家真正想问的吧。你怎么看,评论区聊聊。