☰
Anthropic 25%研发由AI完成,AI编程规模化落地实战指南
2026/9/28 15:15:50 网站建设 项目流程

这一周,AI 行业最热闹的消息不是又发了一个新模型,也不是谁融了多少钱,而是一家头部公司轻描淡写地承认了一件事:Anthropic 内部有四分之一的研发工作,已经是 AI 在干了。消息传开,技术圈直接炸锅。大家震惊的点不是“AI 会写代码”,毕竟这已经见怪不怪,而是“一家做 AI 基础模型的公司,居然官方盖章了自己用AI写代码的比例”。这一下,所有还在观望的团队都坐不住了。于是这一周,几乎所有人都在做同一件事:用真金白银给 AI 编程、AI Agent 下注——买 API、买席位、买服务,甚至花时间去重构自己的研发流程。

我在这行干了十几年,见过太多“技术趋势”从热到凉,但这周的情况明显不一样。它不是某个公司发了个 Demo,而是被一个真实数据点引爆的集体行动。这篇博文我想顺着这条线,聊一聊这个 25% 到底意味着什么,为什么它会让整个行业集体掏钱,以及如果你也想在团队里推 AI 研发,具体该怎么下手,会遇到哪些坑。准备实操的可以直接看第三章和第四章,想看趋势分析的从头读就行。

1. 事件回溯:一家头部 AI 公司承认了大多数人不敢说的事

1.1 25% 这个数字是怎么来的

Anthropic 说的“四分之一的研发”,不是指 AI 帮你搜了个资料、补了个注释,而是指实际产出的工作成果里有 25% 来自 AI。这个口径很关键。代码生成、修复 Bug、写单元测试、补充文档、重构旧模块,这些都算。如果按常规经验折算,相当于一个 10 人研发团队里,有 2.5 个“虚拟工程师”在全职干活,而且这个虚拟工程师不需要睡觉、不会闹情绪、写代码速度还极快。

很多团队其实早就这么干了,只是没人把比例公开。为什么不敢?因为这里有三个隐忧:对外,投资人和客户会觉得你“自研能力不够,靠 AI 凑数”;对内,工程管理者担心公开后团队产生“反正有 AI,人不需要努力”的懈怠心理;人才招聘上,也可能让候选人怀疑“进去以后是不是只做 AI 的校对员”。

Anthropic 敢说出来,说明他们已经把 AI 研发从“实验性应用”推到了“规模化的生产流程”。这个数据的含金量不在于“用了 AI”,而在于“用到了 25% 还能稳定生产、保持质量”。这就不是简单的工具接入,而是组织流程的一次重构。

1.2 为什么这条消息会让全行业抢着买东西

消息出来后,我朋友圈里的技术负责人几乎都在转发,核心讨论点就一个:如果 Anthropic 这种公司已经把 AI 用到这个程度,那我们还不跟进,一年后的效率差距会拉开多大?

很多人以为“所有人都在买同一样东西”说的是某个具体的软件或硬件,其实不是。大家买的是三种东西:大模型 API 的调用权、AI 编程工具的团队席位、以及 AI Agent 平台的企业订阅。本质上是同一个决策:把 AI 从“你个人偷偷用的效率工具”升级成“整个组织的基础设施”。

过去一年,很多公司对 AI 编程的态度是“允许尝试,但不当主业”。这周的消息等于把最后一层窗户纸捅破了——如果行业头部都这么干,那这就不是一个可选项,而是一个必选项。于是技术决策者们开始批量采购,甚至有公司在一天之内把所有研发岗的 Copilot 类工具席位全部开通,效率高得离谱。

2. 所有人到底在买什么,买到手后怎么用

2.1 第一波买的是大模型 API:先解决“能不能用”的问题

这波采购里最直接的动作,是给团队开通 Claude API 或其他大模型 API 的额度。为什么不是等自家模型?因为周期太长、成本太高。直接买大模型的调用权,第二天就能让团队里所有人用上。

一个做 SaaS 的团队告诉我,他们接入之后做的最实际的事情有三件:让 AI 给所有新旧代码自动生成单元测试;把历史遗留的 Python 2 代码批量做语法升级;用 AI 做 Code Review 的第一道检查——检查明显的逻辑漏洞、资源泄漏、异常没捕获等问题。一个月 API 账单从最初的三千元左右涨到了两万多,但团队两个主力后端从“每天加班改 Bug”变成了“每天只处理 AI 提出来真正需要人判断的问题”。

购买 API 时要注意计量方式。按 Token 计费的话,代码类和文档类任务的消耗差距能达到十倍以上。最好按任务类型拆分预算:代码生成、测试生成、代码解释、文档撰写,分别设月度上限。我就见过一个团队,全队拿 API 当搜索引擎用,结果月底账单翻了六倍,没人能说清楚钱花到了哪里。

2.2 第二波买的是 AI Agent:从“帮你写”到“替你干”

这一波更值得关注。如果说 API 和大模型像是“帮你写代码的实习生”,那 AI Agent 就是一个能独立领任务的初级工程师——你给它一个任务描述,它自己拆解步骤、读代码、改文件、跑测试、修编译错误,最后提交一个可审查的 PR。Cursor 和 Codex 的 Agent 模式就是这一类里比较典型的。

买 Agent 和买普通 AI 编程工具的区别在于,Agent 需要你调整团队协作方式。你不能再像以前一样“让 AI 写一段代码,然后合进去”,而是要像一个技术负责人给团队成员派活一样,把需求边界、验收标准、授权范围都提前定义好。

举个实际例子,一个做数据迁移的团队用 Agent 处理了一次任务:把线上 MySQL 库的历史订单数据同步到新的分库架构。任务拆成四步:读取旧库结构、按用户维度拆分数据、执行迁移、核对总数。Agent 自己跑了中间两步,遇到一次死锁,自动重试了三次还改了连接池参数。整个过程跑了接近一整夜,负责人第二天早上只看了一页报告和最终的校验脚本。这种任务放以前,一个中级工程师至少要干两天。

2.3 第三波买的是算力和组织能力:这才是真正的“同一样东西”

前两波是看得见的消费,但很多公司这一周做的真正动作,其实是花钱买“重新组织研发流程”的能力。他们把 GPU 资源和 API 预算统一规划,任命专门的“AI 研发负责人”,甚至开始内部培训工程师怎么写提示词、怎么做 AI 代码审查。

我认识一个中型公司的 CTO,这周做了三个决定:给全组买 Agent 平台账号;把所有开发机的内存升到 64G(因为本地要跑小模型辅助编码);每周五下午固定开 AI 工具复盘会,让每个工程师分享自己这周用 AI 解决了什么实际难题。

这其实是最聪明的一笔投入。工具买回来,如果流程不匹配,效果会大打折扣。我看到不少团队买了工具却没人用,最后变成了“昂贵的摆设”。真正该买的是配套的培训、流程改造和时间冗余——让工程师有时间去试、去踩坑、去总结。

3. 把 AI 研发真正落到地上:提示词、审查与测试

3.1 提示词怎么写才不是“浪费钱”

很多人对 AI 编程的第一印象是“你描述需求,它出代码”。实际做下来,最大的差距在描述质量。我见过工程师写“帮我写个爬虫”,AI 给你一层文件,问题一大堆。而同一款模型,换一种描述方式,产出质量天差地别。

一个比较稳的提示词结构包含五部分:

  • 任务目标:一句话说清楚要做什么,比如“处理用户上传的 CSV 文件并生成月度销售汇总”。
  • 上下文信息:告诉 AI 项目用的什么语言、什么框架、数据库类型、相关文件路径。
  • 约束条件:比如“不要改动现有接口签名”“不要引入新的第三方依赖”“代码要兼容 Python 3.8”。
  • 输出格式:比如“返回完整的 Python 函数,带类型注解和文档字符串”。
  • 验证方式:比如“完成后运行以下命令验证输出是否符合预期”。

一个可以直接抄的示例:

任务:写一个Python函数,读取指定目录下所有CSV文件,按“月份”字段合并,输出每个月的销售额汇总表。 上下文:项目使用Pandas 2.0,已有utils/db.py中定义了save_to_db函数,直接调用即可。 约束:不要使用Dask,不要修改utils/db.py,函数必须带类型注解。 输出格式:返回一个DataFrame,并附上一个main函数的调用示例。 验证方式:用tests/test_merge.py中的测试用例验证。

这样写出来的代码,基本不需要大改。而如果你只写一句“帮我合并CSV”,你得到的代码大概率要来回改好几轮,消耗的 Token 和时间反而更多。

3.2 代码审查的四个关键点

AI 写的代码绝对不能直接合入主干,这是底线。不是说 AI 质量差,而是它很可能在局部正确的前提下,忽略了项目的全局约束。审查的时候,我习惯按这四个顺序检查:

  • 可读性:AI 生成的代码常常过度抽象。明明一个循环能搞定,它可能给你写三层函数嵌套。如果团队成员要花二十分钟才能看懂,那就要求重写。
  • 依赖影响:AI 经常会“自作主张”引入新的依赖包,或者调用一个你项目里根本没用过的标准库。每次 PR 里出现新 import 的地方,都要问一句“这个包是不是必须的”。
  • 异常处理:AI 生成的代码最大的弱点是只写“happy path”。文件读不到、接口超时、数据格式异常——这些场景它经常不处理。审查的时候要逼它补上异常分支和边界条件。
  • 安全隐患:AI 可能把 SQL 片段拼接成字符串、把密钥硬编码进配置。要特别留意所有涉及字符串拼接查询、密钥处理的地方。

除了人工审查,还可以用静态扫描工具跑一遍。很多 CI 流程现在都能自动挂接 AI 检查,把明显的坏味道先拦截掉,让人去处理更复杂的问题。

3.3 测试是兜底网,也是最好的“磨刀石”

如果你想在团队里推广 AI 编程,最好的切入点不是让 AI 写业务代码,而是让 AI 写测试。原因很简单:测试代码有明确的验收标准——能过就是能过,没过就是没过,不存在“我觉得差不多”的模糊地带。

实操方法很直接:把一个模块丢给 AI,让它基于现有代码和需求描述生成完整的单元测试集,然后本地跑一遍。AI 会生成很多你从没想到的边界条件,这些条件往往能提前暴露代码里隐藏的 Bug。一个团队在给支付模块补测试时,AI 生成的测试里包含了一个“金额等于 0 且用户处于灰度状态”的组合场景,直接用一条测试抓出了一个线上偶发故障的根因。

另外,当你给 Agent 派任务时,可以在任务描述里加一句“同时生成对应的单元测试,且测试必须通过”。这句话能显著提高产出质量,原因是 Agent 在写测试的过程中会重新审视自己的代码逻辑,很多低级错误在这一步就被它自己修掉了。

4. 一周踩坑实录:AI 研发常见的 5 个问题与排查方法

4.1 AI 一本正经地“幻觉”了一个不存在的 API

这是最常见的坑。AI 会非常自信地调用一个看起来合理、但实际上不存在的库函数,或者把一个别家 SDK 的方法套到另一个 SDK 上。编译一跑,报错,你回头一看,它还在那儿等着你“继续修”。

排查思路直接:把它写的代码丢给编译器,让错误信息说话。然后要求 AI“先列出你用到的所有外部库和函数,并标注准确的版本号”,再重新生成代码。这个方法能拦截大部分幻觉。如果还出错,就把官方文档的片段复制进提示词里,让 AI 基于文档内容而不是记忆来写。

4.2 AI 写出来的代码风格,跟团队完全不在一个频道

AI 默认是全能的,它可能给你写出超现代的 TypeScript 装饰器风格,而你们的代码库还在用朴素的 CommonJS。结果代码能跑,但一进 Code Review,所有人都觉得别扭。

解决办法是给 AI 提供“格式锚点”:在提示词里粘一段你们现有代码的风格示例,并写明“严格遵循示例代码的命名规范、注释风格和模块组织方式”。实测下来,这个方法比在提示词里写一百条“不要用什么”都管用。

4.3 Agent 跑到一半卡死,或者自己跑飞

Agent 虽然能独立干活,但它并不总能判断“什么时候该停下来问人”。给它一个宽泛的目标,它可能在一个无关紧要的边上绕很久,或者在遇到权限问题时反复尝试同一个失败方案。

我的建议是给 Agent 设定“步骤上限”和“中途检查点”。把一个大的迁移任务拆成多个小任务,每个小任务执行到关键节点就停下,把中间结果贴给你看。一旦发现方向跑偏,立刻修正。这个过程确实更费管理者精力,但比让 Agent 胡乱跑一整晚最后给你一个错误报告要强得多。

4.4 成本没降反而升了,钱去哪了

很多团队推 AI 编程后,发现人确实省了时间,但 API 账单肉眼可见地涨。最极端的一个例子,一个月花掉了六万多的 Token 费,业务代码没写几行——所有工程师都在拿 AI 聊天。

控制成本有三个实用手段。第一,按用途分模型:简单文档和代码解释用便宜的小模型,复杂的重构任务才用旗舰模型。第二,配置提示词缓存和上下文压缩,避免每次请求都重复携带大段项目信息。第三,给每个任务设预算上限,比如“单个任务的 Token 消耗不能超过 50 万”,超了就中断并通知负责人。

4.5 团队里有人坚决不配合,怎么破

工具采购回来了,流程也定了,但团队里总有人觉得“AI 写的不靠谱,还不如我自己写”。这种情绪不能压,要疏通。

一个比较好用的办法是搞内部“效率擂台赛”不强制要求所有人用 AI,而是让愿意用的人结合一个实际模块做演示,对比交付时间。结果一旦摆出来,不需要任何人说服,观望的人自己就想试了。还有一点很关键:要明确告诉大家,AI 写的代码出了问题,责任在审查者,不在写的人。这个安全感一旦建立,团队的参与度会显著上升。

问题典型表现有效排查方案
AI 幻觉代码调用不存在的 API、伪造参数让 AI 标注版本号,用编译器信息反向定位
风格不一致代码能跑但没人愿意维护提供现有代码作为风格锚点
Agent 卡死长时间无进展或反复重试设步骤上限、添加中途检查点
成本失控API 账单数倍上涨分模型路由、缓存、预算上限
团队抵触工具买了没人用内部案例演示、明确责任边界

5. 这一轮趋势下,我个人的一些体会与建议

聊回开头那个 25%。根据我个人的观察,这个数字在未来一年只会升,不会降。AI 写代码这件事,已经从“能不能用”彻底过渡到了“怎么用得更好”的阶段。如果你所在的公司还在观望,我建议不用等什么“完美时机”,直接从一个小范围团队开始试点,选一个业务价值高的中等模块,用两周时间跑完一个完整的 AI 辅助开发周期。投入几个工程师的工时和一点 API 费用,换回来的经验会非常值。

最后再分享一个小技巧:如果你在团队里推 AI 编码,先别急着追求“让 AI 写业务代码的占比”,而是让 AI 全程参与测试、重构和文档维护这些“不起眼但有积累价值”的部分。这些场景验证标准清晰、风险低,团队建立信心之后,再逐步扩大使用范围。这个顺序走对,你花在 AI 上的每一分钱,都能在效率上看到真金白银的回报。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询