自改进引擎:学习循环的五步飞轮
为什么 Hermes 能"越用越好用"?秘密就在这个闭环里
引子:一个真实的故事
2026年3月,一位开发者分享了他的使用体验:
“第一周,Hermes帮我做代码巡检,每次都要我手动指出哪些问题该关注、哪些该忽略。第二周,它开始自动过滤掉我之前标记为’不重要’的警告。第三周,它甚至主动建议了一个我之前没想到的检查维度。到了第四周,我几乎不需要再纠正它了——它已经’学会’了我的巡检偏好。”
这不是魔法,而是 Hermes学习循环(Learning Loop)的实际运作效果。
传统 AI Agent 做完任务就结束了——你纠正了它的错误,下次新对话它可能犯同样的错。Hermes 做完任务后,会自动复盘、自动沉淀经验、自动改进后续行为——你纠正一次,它永远记住。
学习循环的核心逻辑
学习循环可以概括为五个环节,形成一条连续链路:
记忆策划 → Skill创建 → Skill改进 → 检索召回 → 用户建模 ↑ │ └──────────────────────────────────────────────┘ (闭环)这五步不是并列功能,而是前后依赖的闭环。每一步的输出是下一步的输入,最后一步的输出又回到第一步——形成持续运转的飞轮。
用一个真实场景理解五步闭环
假设你让 Hermes 帮你做"每日代码巡检"。
第一轮:冷启动
步骤1:记忆策划
Hermes 没有相关记忆,从零开始执行巡检任务。它检查了所有代码变更,生成了一个包含50个问题的报告。
步骤2:Skill 创建
你指出"其中30个问题是lint警告,我不关心lint"。Hermes 识别到这个反馈有复用价值,自动创建了一个 Skill 草稿:daily_code_review,其中包含规则"过滤lint警告"。
步骤3:Skill 改进
你进一步指出"还有5个问题是测试覆盖率下降,这个我关心"。Hermes 把这个偏好写入 Skill,更新规则为"过滤lint警告,但关注测试覆盖率变化"。
步骤4:检索召回
下次巡检时,Hermes 自动检索到daily_code_reviewSkill,按规则过滤和排序问题。
步骤5:用户建模
Hermes 从多轮交互中提炼出你的偏好模型:“这个用户重视测试质量和安全性,不关心代码风格细节。”
第二轮:飞轮开始转动
记忆策划:Hermes 已经有了你的偏好模型,主动过滤掉 lint 警告,重点关注测试和安全性问题。报告从50个问题缩减到15个。
Skill 创建:你指出"安全漏洞的优先级应该高于测试覆盖率"。Hermes 更新 Skill,增加优先级排序规则。
Skill 改进:Skill 从"过滤+关注"升级为"过滤+关注+优先级排序"。
检索召回:下次巡检,报告不仅更精准,还自动按优先级排序。
用户建模:偏好模型进一步细化:“安全 > 测试 > 性能 > 风格”。
第三轮:飞轮加速
到了第三轮,你几乎不需要再纠正 Hermes 了。它已经"学会"了你的巡检偏好,自动按你的标准过滤、排序、推送报告。你只需要偶尔微调一下——比如新增一个关注维度——Hermes 会自动把这个微调写入 Skill 和偏好模型。
这就是学习循环的威力:不是每次从零开始,而是每次从上次的经验开始。飞轮越转越快,你的投入越来越少,系统的输出越来越精准。
五个环节拆解
环节一:记忆策划——不是全量记录,而是精准提炼
传统 AI 的记忆策略有两种极端:
- 全量记录:把所有对话塞进上下文窗口,窗口满了就截断。就像把每天的每一句话都记进日记——信息量大,噪音也大。
- 短期记忆:只保留当前对话的上下文,新对话从零开始。就像每次开会都假装第一次来——效率极低。
Hermes 的记忆策划走的是第三条路:精准提炼。
原始对话(大量信息) │ 记忆策划(筛选+提炼+结构化) ├── 关键决策 → 写入持久记忆 ├── 可复用方法 → 写入 Skill ├── 用户偏好 → 写入用户模型 └── 噪音信息 → 丢弃核心原则:降低噪音,保留可复用信号。它像一个聪明的编辑——不是把所有素材都放进最终稿件,而是只选最有价值的部分。
环节二:Skill 创建——从经验到方法的自动化
当 Hermes 识别到某个反馈或操作模式有复用价值时,它会自动创建一个 Skill 草稿。
创建条件:
- 同一个问题被纠正 2 次以上
- 用户明确说"每次都这样做"
- 某操作模式在 3 次以上对话中出现
Skill 是"可执行的方法论"。不是一段代码,而是一份结构化的操作指南,告诉 AI:在什么场景下、按什么步骤、用哪些工具,完成什么任务。
环节三:Skill 改进——持续优化的能力
Skill 不是一次创建就固定不变的。Hermes 会在每次使用后评估效果,自动优化:
- 新增规则:用户的新偏好
- 调整优先级:用户显示出的偏好排序
- 删除规则:不再适用的旧规则
- 合并 Skill:相关 Skill 自动合并
环节四:检索召回——精准匹配上下文
当 Hermes 面对新任务时,它会自动检索最相关的 Skill 和记忆。检索策略:
- 语义匹配:基于语义相似度,找到最相关的 Skill
- 场景匹配:基于当前任务的上下文特征
- 时效性加权:近期使用的 Skill 权重更高
环节五:用户建模——从偏好到人格
这是最"智能"的一步。Hermes 不仅记住"你做了什么",还提炼出"你是什么样的人"。
用户建模的输出包含:
- 偏好画像:你喜欢什么风格、关注什么维度
- 决策模式:你做决策时通常考虑哪些因素
- 知识边界:你擅长什么、不擅长什么
- 沟通习惯:你喜欢详细还是简洁、正式还是随意
飞轮效应:从量变到质变
学习循环的真正价值,在于时间的复利:
| 时间 | 飞轮状态 | 你的投入 | 系统输出质量 |
|---|---|---|---|
| 第1周 | 冷启动 | 高(频繁纠正) | 一般 |
| 第2周 | 起步 | 中(少量微调) | 良好 |
| 第3周 | 加速 | 低(偶尔检查) | 优秀 |
| 第4周+ | 稳定 | 极低(很少干预) | 卓越 |
使用时间越长,你的投入越少,系统的表现越好。这是 Hermes 区别于所有其他 Agent 的核心差异。
写在最后
学习循环是 Hermes 的"灵魂"。没有它,Hermes 就是一个普通的 Agent 框架;有了它,Hermes 变成了一个能持续进化的 AI 伙伴。
但学习循环离不开两个关键支撑——记忆架构和Skill 系统。下一篇,我们深入记忆架构,看看 Hermes 如何用"三层记忆"实现从"金鱼"到"老友"的进化。
关注「AI拉呱」,一起探索 AI 技术的前沿落地。
本文是《Hermes Agent 从入门到精通》系列第4篇。