模型还需要微调吗
2026/7/23 14:33:46 网站建设 项目流程

一个大模型时代的好问题

2023 年,一家知名法律 AI 公司做了一件当时看起来很正确的事。

他们和前沿实验室合作,用自己的法律数据微调了一个专属模型。盲测结果:律师们 97% 的情况下更喜欢这个微调模型,而不是当时的王者 GPT-4。

完美的定制化胜利。

但到了 2025 年,同一家公司做了自己的法律基准测试,把微调模型和最新的通用前沿模型放在一起比。结果是:7 个通用模型,从来没有接受过任何法律微调,全部超越了这家公司的定制模型。

Bloomberg 也踩过同样的坑。他们从零训练了 BloombergGPT,后来发现 GPT-4 和 ChatGPT 在很多金融基准上反超了它。

一个反直觉的结论浮出来了:通用模型自己变强了,强到不需要你微调也能干你的专业活。

那微调到底还值不值得做?这篇文章把这个问题一次拆透。

一、微调到底是什么

先说清楚概念。

你拿到一个基座模型,它是从互联网上海量数据训练出来的,有大量通用知识烘焙在权重里。这就像一个什么都学过一点的通才。

微调做的事是:在基座模型的基础上继续训练,但这次用的是聚焦数据集,比如法律合同、企业内部工单,这些是互联网上搜不到的东西。

训练完之后,你得到一个微调模型,它同时拥有基座模型的通用能力和你的专业知识。理论上,它在某些窄任务上应该更好。

听起来很合理。但现实给了它一巴掌。

二、通用模型为什么追上来了

2023 年微调还有优势,到 2025 年就被通用模型反超了。原因有三个:

第一,上下文窗口变大了。

GPT-3 当年的 token 窗口只有 2000。今天的前沿模型动辄 100 万 token 以上。如果模型能直接在提示词里读 500 页法律文档,为什么还要把文档烘焙进权重里?

能在提示词里塞进去的东西,就不需要烘焙进权重。

第二,推理模型出现了。

推理模型在回答前会做扩展思考,一步步推理。这种推理能力来自模型在被提问时的思考深度,而不是几个月前的训练方式。

换句话说,聪明的来源变了:从"训练时记住"变成"提问时思考"。

第三,推理成本持续下降。

模型越来越高效、越来越便宜。当通用模型自己不停变强变便宜,你微调的定制模型就成了一个移动靶。等你微调完发布上线,下一个通用模型可能已经把你超了。

三、不碰权重,也能让模型变专家

如果不动权重,怎么让通用模型表现得像个专家?

视频里给了一套完整的定制化技术栈,全部不需要碰模型权重:

1. RAG(检索增强生成)

不把文档训练进模型,而是在查询时实时检索相关文档,塞进提示词里。文档更新了,RAG 立刻能用新数据,不用重新训练。

2. Context Engineering(上下文工程)

好的提示词不是一句话,而是一个精心组装的上下文包:系统提示、相关数据、格式要求,打包在一起。模型读到的上下文质量决定输出质量。

3. Agent Skills(智能体技能)

把程序性知识打包成结构化的技能文件。比如不微调模型去学某个特定数据库的 SQL 写法,而是写一个 SQL 技能文件,任何通用模型都能按需加载使用。

微调是把知识烘焙进权重。RAG、上下文工程和技能是把知识放在外面,按需喂给模型。

这三层的共同点:模型权重一动不动,但行为完全可以定制。而且更新成本远低于微调。

四、微调不是免费的

在决定微调之前,要算清几笔账:

  • 数据收集成本:需要准备高质量的聚焦数据集

  • 评估成本:每次微调后都要评估效果,避免回归

  • 维护成本:通用模型每升级一次,你的微调模型可能就要重训

  • 机会成本:花在微调上的时间和算力,可能花在 RAG 和上下文工程上回报更高

微调不是一次性投入,是一个持续的维护承诺。

五、那微调什么时候还值得做

微调没有死,但它的适用场景比 2023 年窄了很多。目前还有三个场景值得考虑:

场景一:低延迟是硬约束

比如语音助手接电话,必须实时响应。前沿推理模型思考太慢,一个小型微调模型可能更快。

场景二:蒸馏

用大模型生成高质量输出,然后用这些输出微调一个小模型。本质上是把大模型的推理能力“压缩”进小模型里,用更低的成本获得接近的效果。

场景三:强化微调(RFT)

不用固定答案训练,而是用一个评分器(grader)给候选答案打分,模型学习让高分答案更可能出现。但 RFT 有个硬限制:只有当输出能被程序化评分时才有效,也就是必须有明确对错的场景。

六、今天的决策框架

把所有东西放在一起,今天面对“要不要微调”这个问题,决策顺序应该是:

优先级方法触发条件
1基座模型 + 提示词工程默认起点
2+ 上下文工程需要更精确的输出控制
3+ RAG知识是新鲜的或专有的
4+ Agent Skills缺少程序性操作知识
5+ 微调(LoRA 等)以上全部解决不了的特定瓶颈

先把不碰权重的技术栈用满,微调是最后一张牌,不是第一张。

大多数情况下,你走到第三或第四层就够了。只有遇到延迟、蒸馏或可评分场景时,才值得翻到第五层。

结尾

2023 年,微调是定制化的默认答案。2025 年,它变成了最后手段。

这不是因为微调变差了,是因为不碰权重的替代方案变强了,而且通用模型自己追上来了。

技术选型的本质不是选最强的工具,是选成本最低、维护负担最小、能解决问题的那一层。

那你现在的项目,走到第几层了?有没有在第一层就能解决的问题,却被你用微调复杂化了?

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询