Rich Sutton最近的一个判断在AI圈里引起了不小的讨论:大模型可能正被困在“局部最优”,真正的智能必须学会持续学习。这个观点从强化学习之父嘴里说出来,分量和普通技术评论不太一样。如果你正在做大模型应用开发,或者研究强化学习算法,这篇文章值得认真读完。
先说我对这个判断的理解:Sutton不是在否定大模型的成就,而是在指出一个更深层的结构性问题——当前大模型的学习范式本质上是一次性的,训练完成之后,模型就凝固了。人类智能不是这样的。人每天醒来都在用新经验调整自己的认知,遇到新任务时能快速适应,不会把昨天学到的东西全部忘掉。
这篇文章会从三个层面展开:第一,为什么说大模型处于“局部最优”,这个判断的推理逻辑是什么;第二,持续学习在技术上到底是什么,和传统微调、上下文学习有什么区别;第三,对做AI应用开发和算法研究的读者来说,这个判断意味着什么,有哪些值得关注的技术方向。
1. 这篇文章真正要解决的问题
先从一个具体的痛点说起。很多做AI应用的团队都会遇到这种情况:模型刚上线的时候效果很好,但跑了一个月之后,用户的问题开始变得奇怪起来,模型开始答非所问。
传统的解决办法无非两条路:一条是把新的对话数据捞回来做微调,另一条是升级到参数更大的模型。但这两条路都有问题。微调需要标注数据、需要算力、需要评估回归,而且经常出现“学了新知识忘了旧知识”的灾难性遗忘。换大模型更直接,但成本成倍增长,而且换完之后过几个月还是会遇到同样的问题。
这个问题的本质是什么?是模型通过学习获得的知识是静态的。你训练它的那一刻,它的世界观就被冻结了。你后续做的所有“更新”,本质上都是在一个已经冻结的系统上打补丁。
Sutton说的“局部最优”就是这个意思。当前大模型的能力曲线看起来很高,但它是朝着“一次性学习”这个方向优化出来的局部最高点。这个方向上已经很难再有质的突破。真正的突破可能需要换成另一条优化曲线——一条让系统能无限学习、持续演化、与真实环境不断互动的曲线。
这篇文章适合三类读者:
- 正在做大模型应用开发,被数据更新和模型迭代问题困扰的工程师
- 研究强化学习、持续学习方向的算法同学,想了解这些技术和大模型的结合点
- 对AI技术趋势感兴趣的读者,想理解“后大模型时代”技术走向的判断依据
2. 大模型的“局部最优”:Sutton判断的核心逻辑
要理解Sutton的判断,先得理解“局部最优”和“全局最优”这两个概念的区别。在优化理论里,局部最优是指一个解在周围的小范围内已经是最好的了,但放到整个解空间里,还有更好的区域存在,只是你目前看不到、走不到。全局最优则是整个解空间里最好的解。
Sutton是把整个AI发展路径看成了一次巨大的优化过程。当前大模型的路线——海量数据预训练、人类反馈对齐、超大参数规模——在这条路线上已经做到了极致。GPT系列、Claude、Gemini等模型展现出的能力,就是这条路线上的“局部最优”解。
但问题在于,这条路线的优化目标和真正的智能目标之间存在着根本偏差。
再回到Sutton的著名文章“痛苦教训”(The Bitter Lesson)。那篇文章的核心观点是:70年来AI研究最大的教训就是,靠人类手工设计的知识最终都会被大规模的算力和搜索方法打败。1990年代的专家系统和手工特征工程输给了机器学习,2010年代的人工设计网络结构输给了大规模深度学习。
从这个逻辑推导下来,当前大模型的大规模预训练是“用算力代替手工设计”的又一次胜利。但Sutton认为,这个胜利也不该被当成终点。下一次突破,依赖的是更通用的学习机制,尤其是让智能体在与环境的持续交互中自主发现规律,而不是继续靠人类批量制造静态的、预先标注好的数据。
顺着这个思路看当前大模型的技术路线,会发现几个明显的结构性问题。
第一个问题是训练目标与实际应用的错位。大模型的训练目标是预测下一个token,本质上是在“模仿”训练数据的统计规律。你在部署一个客服机器人的时候,你希望的是它能理解业务逻辑、能应对没见过的新问题、能从错误反馈中改进。但训练目标从来没有直接优化过这些能力。
第二个问题是知识的固化。模型一旦完成训练,所有知识就被冻结在权重里。你让模型“学会”一个新领域的规则,只能通过微调让它把新知识“覆盖”进去,或者通过RAG在推理时临时拼接外部信息。这两种方式都不是真正的持续学习——一种是修改旧系统,一种是绕过旧系统,系统的核心学习能力并没有提升。
第三个问题是缺乏真实反馈闭环。人类学习最有效的方式是行动、获得反馈、调整策略。大模型在训练阶段基本没有这个机制。RLHF虽然在形式上引入了奖励模型,但它本质上是人类偏好的静态映射,而不是模型与真实世界互动产生的动态奖励信号。
这三个结构性问题的叠加,构成了Sutton所说的“局部最优”——当前范式在最优化自身的目标函数上已经很强,但那个目标函数本身和真正的智能不是一回事。
3. 从“痛苦教训”到持续学习:Sutton主张的演变
要理解Sutton说“AI必须学会持续学习”这句话的分量,需要把这个判断放回到他近三十年的研究脉络里看。这不是一个突然冒出来的观点,而是长期思考的延续。
Sutton在强化学习领域的地位不需要多介绍。他和Barto合著的《Reinforcement Learning: An Introduction》是公认的强化学习经典教材。他的研究重心一直没有离开过“智能体如何从与环境的交互中学习”这个核心问题。
“痛苦教训”那篇文章把第一层意思说清楚了:不要手工设计复杂机制,要让学习算法从数据和计算中自己找规律。到了2019年之后,随着大模型能力越来越强,他的关注点自然地转向了第二层问题:这些“从数据中学出来”的系统,要如何获得持续更新的能力。
一个值得注意的背景是,Sutton长期关注在线学习和时序差分学习(Temporal Difference Learning,TD Learning)。这种学习范式和当前大模型的批处理训练有本质区别。TD学习的特点是边行动边学习,每一步都在用新的经验更新自己的价值估计,不需要把所有历史数据重新过一遍。
这就是持续学习的核心思想:学习不是一个“训练-部署”的两阶段过程,而是部署之后还在继续发生的实时过程。模型在使用过程中不断吸收新信息、调整策略、优化行为。
从技术史的角度看,这个主张是对“学习”这个概念的一次回归。在早期AI研究里,学习系统被设计成和环境紧密耦合的。后来深度学习的成功改变了行业对学习的理解——学习变成了一个离线的、大规模计算的过程:你收集海量数据,用显卡集群跑几天,得到一组权重,然后部署上线。
Sutton的持续学习主张本质上是想重新夺回“在线”这个维度。他可能认为强化学习的真正优势不在于现有的游戏AI和机器人控制,而在于提供了一个思考“智能体如何与环境持续互动”的完整框架。
4. 持续学习的技术内涵:概念与核心挑战
持续学习(Continual Learning)在机器学习领域已经有比较明确的定义。它研究的是模型在面临新任务、新数据时,如何在不彻底遗忘旧知识的前提下持续更新能力。围绕持续学习有几个核心问题,值得逐一拆开看,因为它们恰恰是理解Sutton判断的关键。
第一个核心问题是“稳定性-可塑性困境”。稳定性指的是模型维持已有知识的能力,可塑性指的是模型学习新知识的能力。理想状态下两者兼得,但实际训练中这是一对天然矛盾。要吸收新知识,权重就要发生较大改变;权重改变幅度一大,旧知识就被破坏了。这个矛盾在经典的监督学习和现在的预训练模型里都普遍存在。
第二个核心问题是灾难性遗忘。这是持续学习中被研究得最多的现象。一个模型在任务A上训练到收敛,再去训练任务B之后,模型在任务A上的表现会大幅下降。原因是神经网络在任务B的梯度更新中,把对任务A有用的特征表示给覆盖了。
第三个核心问题是数据分布的漂移。真实世界的数据不是固定不变的。用户的提问风格在变,业务规则在变,知识在更新。离线训练假设“训练数据和测试数据同分布”,在长周期的真实场景中基本不成立。持续学习需要让模型主动跟踪分布变化,而不是被动地接受分布偏差带来的效果衰减。
从强化学习的视角看,持续学习还有一个额外维度:策略与环境的共同演化。智能体在学习的同时,它的行为也在改变环境反馈的分布。这比被动的监督学习更复杂,但更接近人类学习的真实状态。
当前研究界在持续学习方向上探索了几条技术路径。
路径一是记忆回放,也就是在训练新任务时,把旧任务的样本混入训练集一起学习。这个方法简单有效,但依赖历史样本的存取,对大模型的提示词记忆机制而言,相当于在推理层面不断拼接历史上下文。
路径二是正则化约束,通过对权重的更新施加约束来减少对重要旧知识的破坏。代表算法如EWC(Elastic Weight Consolidation),其思路是识别对旧任务最重要的参数,在更新时限制这些参数的变化幅度。
路径三是参数隔离与扩展,为新任务动态新增参数模块,旧模块保持不动。渐进式网络和专家混合模型都属于这一类思路。在LLM场景里,LoRA本身就有参数隔离的特征——你为某个新任务训练了一组低秩适配器,原模型权重没变。
路径四是基于强化学习的方法。智能体不是在静态的数据集上学习,而是在环境中通过试错获得奖励信号来调整策略。这种学习方式天然就是持续的——环境在变,策略在跟着变,没有“训练结束”的时刻。
技术背景说完,再看Sutton判断的微妙之处。他说的“AI必须学会持续学习”,可能不只是指让当前的大模型在推理时读取更多上下文,或者定期做增量微调。他可能是在指向一种范式层面的转变:让智能体在真实环境中边行动边学习,用不断产生的真实经验去驱动自身能力的持续增长。这种转变一旦发生,AI的评估方式、训练方式、部署方式都会发生根本性的变化。
5. 当前大模型应对“持续变化”的三种方案与局限
现在实际工程领域已经有一些试图让大模型应对持续变化的方案,它们各有各的价值,但也都没有真正实现“持续学习”。搞清楚这些方案的边界,才能理解Sutton判断的针对性到底在哪里。
第一种方案是上下文学习,也就是把新信息写进系统提示词,让模型在推理时“临时”拥有这些知识。ChatGPT的联网搜索、各类AI助手的插件机制,本质上都是这个模式。你不需要改模型权重,把外部信息塞进上下文就行。
这种方案的优点是即插即用、即时生效、没有训练成本。但天花板非常明显:上下文窗口有限,放不下持续增长的知识量;每次调用都要重复输入大段上下文,推理成本和延迟都在上升;而且模型只是在“借用”信息,它没有真正把知识内化到自己的认知结构里。你关掉对话窗口,模型还是原来的模型。
第二种方案是微调,包括全参微调和LoRA这类参数高效微调。LoRA的优点是只训练一小部分低秩矩阵参数,成本远低于全参微调,在很多垂直领域任务上都有效果提升。
但微调同样不等同于持续学习。它本质上还是离线批处理:收集一个固定数据集,训练一次,评估一次,部署。下一次数据变了,又要重新来一遍。而且你每做一次微调,都要面对灾难性遗忘风险和保护原有能力的平衡问题。微调周期再短,它也是“离散事件”而不是“持续过程”。
第三种方案是RAG,检索增强生成。这个方案解决了知识更新的时效性,通过外挂向量数据库把最新资料提供给模型。不重新训练模型,知识就更新了。
RAG的问题在于,它把“知识”和“认知”割裂了。检索到的文档只是模型可以参考的外部素材,模型本身的推理能力、判断能力、对新问题的泛化能力没有因为检索而提升。当问题需要多步推理、需要把检索到的信息和模型的内部知识深度融合时,RAG的表现并不稳定。
从这三种方案的局限看,Sutton的批评是有力的。当前大模型处理变化的方式本质上都是“绕开变化”:要么临时抄信息,要么定期打补丁。没有一种方案把“持续适应变化”作为模型的核心能力来设计。
6. 强化学习框架下的持续学习:几个关键技术方向
如果顺着Sutton的判断往前走,真正值得关注的是强化学习框架下的持续学习技术。这个方向目前还不是主流,但已经出现了几个值得留意的技术路径。
第一个值得关注的是基于模型的强化学习。主流深度强化学习算法分两种:无模型方法直接根据环境反馈学习策略,样本效率很低,打一局游戏要试错上万次。基于模型的方法先学习一个环境动态模型,再在这个模型里进行想象和规划,大幅提高样本效率。
这一点对持续学习的意义很直接。真实环境中不可能有无限试错机会。一个能学习“环境规律”的系统,可以把新经验快速泛化到类似场景,而不需要每个新情况都从头开始。
第二个方向是世界模型。从材料看,Sutton一直强调从与环境交互中获取知识,世界模型就是这个思想的技术实现路径。世界模型构建了一个简化外部环境的内部表示,使用智能体像人类一样对“如果做了X会怎样”进行模拟预测。
世界模型与持续学习的连接也在这里:真实环境在变,世界模型本身就应该持续更新。当模型发现预测出现偏差,就说明环境变了,系统就会主动去更新自己的世界模型。这种机制是当前大模型完全没有的能力。
第三个方向是离线强化学习。这个方向解决的是“强化学习依赖在线交互”这个工程瓶颈。在很多真实场景里,你只能从既有数据中学习,无法边做边学。离线强化学习专门研究如何从固定数据集里学到好策略,算法代表包括IQL(Implicit Q-Learning)等。
具体的思路是,在IQL中通过估计数据集里的行动价值分布来学习策略,而不是对所有未尝试过的行动做乐观估计。这个技术的价值在于,它为强化学习类算法引入真实业务场景提供了路径——先离线学习历史经验,再逐步向在线策略演化。
第四个方向是分层强化学习。持续学习的场景往往是复杂任务的长周期决策问题。分层强化学习的核心思想是把一个大任务分解成若干子任务,上层策略选择子目标,下层策略执行具体动作。这种结构天然适合持续学习的场景。
这个技术方向值得关注的原因在于,当环境变化时,变更的是部分子策略而不是整个策略体系。
7. 对开发者的启示:现在能做什么
Sutton的判断是战略层面的,但它的影响会传导到工程层。作为开发者或研究者,现在能做什么?这里给几个明确的建议。
第一,别迷信“一次性完美模型”。如果项目是长期运行的,从一开始就用工程机制把模型设计成“可迭代”的结构。把评估体系建好,把数据回流管道建好,把模型版本管理好,不要等到效果崩了再开始救火。
第二,关注在线再训练的工程链路。目前环境里强化学习类算法在在线持续迭代场景已经有了很多实践案例,比如推荐系统中的在线学习框架、机器人控制中的Sim2Real迁移方案。在CV或NLP任务中,也可以通过在线数据回流和增量训练框架来模拟“持续学习”的闭环。
第三,把RAG和微调当手段而不是终点。RAG解决时效性问题很好用,微调可以让模型更贴近垂直领域,但它们都只是“让系统跟上变化”的辅助手段。选择时先搞清楚你的项目到底缺的是知识更新还是行为调整。知识更新优先RAG,行为调整才需要考虑微调或强化学习类算法方法。
第四,在人才培养上保持跨学科视野。持续学习恰好位于多领域交叉位置。如果你带团队或者自己规划技术成长路线,建议同时关注强化学习、在线学习、元学习这几个方向的进展,因为它们已经有很多理论储备可以被持续学习借鉴。
第五,形成“评估持续创新能力”的意识。现在评估模型能力基本都是跑静态基准测试:给一批固定题目,对比分数。如果未来AI系统真的要持续学习,静态评测就不够用了。需要的是动态评测,比如新任务出现后,系统的适应速度有多快。
8. 常见误区:持续学习不是记忆更多数据
围绕持续学习这个方向,CSDN评论区里常见的几种误区值得单独说一下。
误区一:“持续学习就是让模型记住更多东西”。如果只是记忆更多,RAG已经做到了,把你的知识库无限扩大就行。但持续学习的核心是让模型获得更新知识结构的能力,不只是让它们能被检索到。
误区二:“持续学习和微调是一回事”。微调是在固定数据集上推进模型朝一个确定目标偏移,持续学习是希望模型在开放环境中无限适应。工程上看起来都是“更新模型”,但目标函数完全不同。微调模型更新时目标就是当前这批数据,持续学习每次更新都要考虑对旧能力的保护和对未来能力的预留。
误区三:“有了大模型就不用强化学习了”。这个把反对意见理解反了。Sutton强调强化学习的研究传统本身就是对齐大模型和智能这个终极目标的关键路径。强化学习不会因为大模型而失去价值,恰恰会成为下一阶段AI演化的核心机制。
误区四:“持续学习还太远,跟我们无关”。从工程上看其实没那么远。任何长期运行的系统都面临数据分布漂移的问题。你在为一个业务系统做大模型应用,最迟三个月后就会遇到知识更新和效果衰减的挑战。持续学习要解决的是这些问题,也是你现在就可以行动的技术方向。
9. 总结与后续思考
回到Sutton的判断本身。他认为大模型被困在局部最优,不是否定大模型的成果,而是在推动AI研究走向下一个阶段。当前的大模型范式确实在“从静态数据中学习”这个方向上已经接近极限,要真正逼近AGI级别的能力,必须让系统具备持续学习能力——在与环境的交互中不断吸收经验、调整策略、演化能力。
这个判断的技术基础是扎实的。从强化学习的在线交互、基于模型的规划、世界模型构建,到离线强化学习带来的实际应用路径,这些方向共同构成了“持续学习”的技术底座。大模型已经在语言理解、知识问答等任务上证明了“规模+数据”的力量,而下一代突破的钥匙很可能就在于如何让规模化的智能真正跑起来、学起来。
如果你正在做AI方向的开发或研究,Sutton的判断解释了不少你正在遇到的工程困境。静态模型应对动态环境的结构性矛盾会长期存在。期待在评论区看到你的实践心得,一起讨论这个方向上的具体问题。