☰
AI 为什么总重复犯错?根治方案与真实数据
2026/9/25 8:11:36 网站建设 项目流程

一个 AI Agent 的系统性缺陷,以及一种把它根治掉的方式。
社区技术文 · 配套项目:diegin-skill> 2026-08-25 更新:随迭进 v3.9.10(律令九章版)同步刷新机制与实测数据—## 开头:先看一个真实的崩溃现场上周五,你让 AI 改一个 UTF-8 编码问题。它试了三种方案,最后对了。这周一,同一个项目,同一个报错,它又从头试起——三种方案,先错两个,再「重新发现」正确的那一个。你以为它记住了?没有。它根本不记得上周发生过什么。这不是个例。AI 重复犯同一个错,不是它笨,是它的结构里没有「记住教训」这一层。如果你长期使用 AI 写代码、做分析,下面这些场景大概率不陌生:1.编码问题反复踩坑:同一个 UTF-8 / 转义 / 路径问题,上周犯过,这周换一个会话又来了;2.修好了这次,下次从零开始:本轮明明修复成功,方法没有沉淀,下一轮 AI 又回到「从头试错」;3.偶然用对了的方法被忘掉:成功只是运气,不构成可复用的知识;4.规则写了却像假的:明明给 AI 写了规则,它却从不触发——规则存在,但等于没有。## 反常识:换更强的模型,也救不了这 4 条很多人第一反应是「换个更强的模型」。但以上 4 条,换 GPT 也好、换 Claude 也好,大概率照旧。为什么?因为根子在系统结构,不在单次推理。更强的模型把「这一次」做得更好,但「上一次的教训」「成功的经验」「规则有没有真生效」——这些不在模型的推理范围里,在系统的结构里。模型解决「这一次怎么答对」;结构才能解决「这一次之后,怎么不再错」。## 一、根因:四个「没有」### 1. 没有状态
会话结束后,行为经验随之消失。AI 对「上个会话怎么解决的」毫无记忆,每次都是「新员工第一天」。### 2. 没有负向闭环错误发生后,缺少「检测 → 归因 → 固化 → 验证」的自动链路。错误被修正,但修正本身没有被沉淀。### 3. 没有正向闭环成功只是偶然。做对的方法没有被识别、提炼、固化,下次可能又绕回错误路径。### 4. 没有验证即使写入了规则/记忆,也没有机制证明「它真的会生效」。规则可能引用不存在的字段、永远匹配不上——安静地失效。>这不是假设,是我们踩过的坑:迭进早期实测,规则库 215 条 active 规则中202 条从未触发(93.9% 是死规则),其中 7 条 BOM 编码规则全部失效,导致同一个编码问题在 4 天里复发 4 次。规则写了,但「像假的」。## 二、为什么单靠 Prompt 解决不了-Prompt / 系统提示词是静态指令:一次性约束行为,无状态、无闭环、不会自举进化。-向量记忆库 / RAG解决的是信息检索,不等于行为约束——检索到了知识,AI 也不一定遵守。-LOOP 类循环(Reflexion 等)解决「这一次」怎么做好:执行→反馈→反思→再执行。但它循环结束经验即散,且很少固化成功经验。真正缺的是一个
常驻的进化层
:在每次会话、每次工具调用背后持续运行——检测错误、固化修复、沉淀成功、跨域泛化、验证真伪、续接任务。## 三、律令九章原则网络:一种可运行的解法「迭进(Diegin)」用九条元原则构成一个互联网络来干这件事(v3.9.10,四律三门一锁一镜):| 章 | 原则 | 别名 | 方向 | 一句话 ||:-😐:–|:–|:–|:–|| 一 | 攻七 | 行知律 | 正向强化 | 把验证过的正确做法提炼、固化、复用 |
| 二 | 守三 | 省知律 | 负向纠错 | 检测错误、拦截风险、深度复盘 || 三 | 一二不过三 | 三错锁 | 安全阀 | 初犯立改验 → 再犯锁其途 → 三犯剑落下 || 四 | 举一反三 | 通变门 | 跨域泛化 | 从个案提炼通则,经回归校验后激活 || 五 | 去伪存真 | 真伪门 | 真伪验证 | 言必有证 → 证必可验 → 验证为真 || 六 | 预策 | 裁决律 | 权衡决断 | 原则冲突时按 P0-P6 硬编码裁决 || 七 | 持存 | 恒常门 | 任务续接 | 断点不丢,跨对话恢复 || 八 | 止观 | 完形律 | 完形封存 | 事毕清零,不追加纠错 || 九 | 自照镜 | 方向之镜 | 自我审视 | 回望所行,拨云见路 |> 原则冲突时按预策律 P0-P6 裁决:P0 去伪存真无条件优先 → P1 一二不过三阻断优先 → P2 完形律清零 → P3 恒常门任务恢复 → P4 攻七/守三置信度裁决 → P5 staging 不参与实时仲裁 → P6 Mindol 语义权重(±0.3 / 单轮 ±0.1)。缓急律已从九章移除,降级为宕机时段/批处理的节奏工具。### 四个最关键的设计① 错误要「升级」,不是重试(一二不过三)- 第 1 次错:立即自动修复并验证(初犯立改验);- 第 2 次同类错:归因过滤后写入硬阻断(再犯锁其途,内生惯性直接拦住);- 第 3 次:推翻原阻断方案、通知用户、系统升级(三犯剑落下)。- 效果:错误从「反复出现」变成「出现一次、被记住、被拦住」。② 成功也要沉淀(攻七)做对的方法被识别后:及时推荐(高置信度优先采用)→ 仲裁加权复用 → 跨域泛化 → 自动采纳反馈(采纳 +0.5 / 否决 ×0.7)。成功不再是运气,而是资产。
③ 规则必须证明自己活着(去伪存真)- 写入门禁:trigger 引用不存在的字段 → 拒绝写入(确定性死规则);- 周期审查:active 超 7 天从未触发的规则 → 死规则候选,分级处置;- 验证原则:
「代码存在 ≠ 生效」
——触发次数 > 0+ 审计日志有阻断记录,才算真生效。④ 任务要能断点续接(持存·恒常门)- 每个任务有 task_id、完成标准、待办清单,随会话持久化(不做完不丢);- 中断后新对话说一句「恢复 XX 那个任务」→ 意图匹配 + 候选确认 → 自动续接;- 效果:长任务不再因会话结束而「从零开始」——记忆从「想起」升级为「恢复」。## 四、真实数据:它真的让错误不重犯吗?以下数据来自迭进引擎实测(2026-08-25 采集,可复现):-拦截与净化:256 条规则(59 条 active 在岗生效 + 188 条历史规则经去伪存真归档);成功模式库 24 条(23 条自动采纳);-记忆有生命周期:2,533 条记忆单元(动态增长)——权威记忆永久保留,工具中间日志按 1/3/7 天分档休眠,非无限膨胀;-跨对话恢复破冰(恢复率 0 → 首次实证):2026-08-18 用户一句「恢复 A股模拟盘那个任务」→ 意图匹配唯一高置信命中(0.760,领先次名 0.286)→ 任务自动恢复;目前恒常门共 379 个任务快照可跨会话续接;-一二不过三 9 次阻断:归因到 3 类根因(image_url / command_failure / tool_error_Bash),修复全部 verified,铁墙级规则(critical/blocking)直接拦在阻断层,同类错误不再复发;

  • 举一反三泛化规则在库:历史实证 71/74 次命中、零误伤,人工复核后保留;-死规则治理:215 条中 202 条死规则被揪出(7 条 BOM 编码规则全部失效、同一编码问题 4 天复发 4 次),触发验证门上线后不再复发——当前死规则/空壳模式/伪证据全为 0;-质量基线:test_all 33/33(实测)、引擎自检 16/16 全绿、审计日志全量可查。## 五、边界与诚实声明- 迭进提升的是长期可靠性,不承诺「永不犯错」——它让错误被检测、被固化、不再重犯;- 引擎/契约异常时一律放行业务(标注未验证),不因进化层故障阻断用户工作;- 规则引擎对结构化/半结构化任务收益最大;纯开放创作场景仍需人工裁决;- 恢复率早期基于单次实证(样本小),持续累积中;- 项目纯本地、零外部 API 依赖,数据不出本机。## 结尾AI Agent 进入生产环境的瓶颈,已经从「能不能做」转向「可不可信」。同一个错犯两次,再强的能力也难挽回信任。进化层解决的不是单次任务的成败,而是长期可靠性——让 AI「错不重犯、对能复用、越用越聪明、断了能续上」。如果你也在被「AI 反复犯同一个错」折磨,这篇文章可能帮你省下几周踩坑时间。项目开源在 github.com/linsong-dev/diegin-skill,README 有 30 秒上手,领域规则包(编码/写作/数据分析)开箱即用。觉得有用,点个 star,让更多被 AI 气到的人看到这条解法。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询