一个大模型时代的好问题
2023 年,一家知名法律 AI 公司做了一件当时看起来很正确的事。
他们和前沿实验室合作,用自己的法律数据微调了一个专属模型。盲测结果:律师们 97% 的情况下更喜欢这个微调模型,而不是当时的王者 GPT-4。
完美的定制化胜利。
但到了 2025 年,同一家公司做了自己的法律基准测试,把微调模型和最新的通用前沿模型放在一起比。结果是:7 个通用模型,从来没有接受过任何法律微调,全部超越了这家公司的定制模型。
Bloomberg 也踩过同样的坑。他们从零训练了 BloombergGPT,后来发现 GPT-4 和 ChatGPT 在很多金融基准上反超了它。
一个反直觉的结论浮出来了:通用模型自己变强了,强到不需要你微调也能干你的专业活。
那微调到底还值不值得做?这篇文章把这个问题一次拆透。
一、微调到底是什么
先说清楚概念。
你拿到一个基座模型,它是从互联网上海量数据训练出来的,有大量通用知识烘焙在权重里。这就像一个什么都学过一点的通才。
微调做的事是:在基座模型的基础上继续训练,但这次用的是聚焦数据集,比如法律合同、企业内部工单,这些是互联网上搜不到的东西。
训练完之后,你得到一个微调模型,它同时拥有基座模型的通用能力和你的专业知识。理论上,它在某些窄任务上应该更好。
听起来很合理。但现实给了它一巴掌。
二、通用模型为什么追上来了
2023 年微调还有优势,到 2025 年就被通用模型反超了。原因有三个:
第一,上下文窗口变大了。
GPT-3 当年的 token 窗口只有 2000。今天的前沿模型动辄 100 万 token 以上。如果模型能直接在提示词里读 500 页法律文档,为什么还要把文档烘焙进权重里?
能在提示词里塞进去的东西,就不需要烘焙进权重。
第二,推理模型出现了。
推理模型在回答前会做扩展思考,一步步推理。这种推理能力来自模型在被提问时的思考深度,而不是几个月前的训练方式。
换句话说,聪明的来源变了:从"训练时记住"变成"提问时思考"。
第三,推理成本持续下降。
模型越来越高效、越来越便宜。当通用模型自己不停变强变便宜,你微调的定制模型就成了一个移动靶。等你微调完发布上线,下一个通用模型可能已经把你超了。
三、不碰权重,也能让模型变专家
如果不动权重,怎么让通用模型表现得像个专家?
视频里给了一套完整的定制化技术栈,全部不需要碰模型权重:
1. RAG(检索增强生成)
不把文档训练进模型,而是在查询时实时检索相关文档,塞进提示词里。文档更新了,RAG 立刻能用新数据,不用重新训练。
2. Context Engineering(上下文工程)
好的提示词不是一句话,而是一个精心组装的上下文包:系统提示、相关数据、格式要求,打包在一起。模型读到的上下文质量决定输出质量。
3. Agent Skills(智能体技能)
把程序性知识打包成结构化的技能文件。比如不微调模型去学某个特定数据库的 SQL 写法,而是写一个 SQL 技能文件,任何通用模型都能按需加载使用。
微调是把知识烘焙进权重。RAG、上下文工程和技能是把知识放在外面,按需喂给模型。
这三层的共同点:模型权重一动不动,但行为完全可以定制。而且更新成本远低于微调。
四、微调不是免费的
在决定微调之前,要算清几笔账:
数据收集成本:需要准备高质量的聚焦数据集
评估成本:每次微调后都要评估效果,避免回归
维护成本:通用模型每升级一次,你的微调模型可能就要重训
机会成本:花在微调上的时间和算力,可能花在 RAG 和上下文工程上回报更高
微调不是一次性投入,是一个持续的维护承诺。
五、那微调什么时候还值得做
微调没有死,但它的适用场景比 2023 年窄了很多。目前还有三个场景值得考虑:
场景一:低延迟是硬约束
比如语音助手接电话,必须实时响应。前沿推理模型思考太慢,一个小型微调模型可能更快。
场景二:蒸馏
用大模型生成高质量输出,然后用这些输出微调一个小模型。本质上是把大模型的推理能力“压缩”进小模型里,用更低的成本获得接近的效果。
场景三:强化微调(RFT)
不用固定答案训练,而是用一个评分器(grader)给候选答案打分,模型学习让高分答案更可能出现。但 RFT 有个硬限制:只有当输出能被程序化评分时才有效,也就是必须有明确对错的场景。
六、今天的决策框架
把所有东西放在一起,今天面对“要不要微调”这个问题,决策顺序应该是:
| 优先级 | 方法 | 触发条件 |
|---|---|---|
| 1 | 基座模型 + 提示词工程 | 默认起点 |
| 2 | + 上下文工程 | 需要更精确的输出控制 |
| 3 | + RAG | 知识是新鲜的或专有的 |
| 4 | + Agent Skills | 缺少程序性操作知识 |
| 5 | + 微调(LoRA 等) | 以上全部解决不了的特定瓶颈 |
先把不碰权重的技术栈用满,微调是最后一张牌,不是第一张。
大多数情况下,你走到第三或第四层就够了。只有遇到延迟、蒸馏或可评分场景时,才值得翻到第五层。
结尾
2023 年,微调是定制化的默认答案。2025 年,它变成了最后手段。
这不是因为微调变差了,是因为不碰权重的替代方案变强了,而且通用模型自己追上来了。
技术选型的本质不是选最强的工具,是选成本最低、维护负担最小、能解决问题的那一层。
那你现在的项目,走到第几层了?有没有在第一层就能解决的问题,却被你用微调复杂化了?