法律大模型怎么选?三款开源中文法律 AI 的选型与部署实战
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
Awesome-Chinese-LLM 是一个开源中文法律大模型资源仓库,把獬豸、LaWGPT、ChatLaw 等一批法律 LLM 的基座、训练数据和部署方式整理在一处。本文面向不想支付高咨询费、只想自己跑通中文法律 AI 的普通用户,直接给选型结论和最小部署方案。
按场景选法律大模型,而不是按参数选
选法律大模型先看你要干什么,再看模型多大。下面三个最常见的场景,各给一个取舍最清晰的候选,事实依据均来自仓库 doc/Legal.md:
| 使用场景 | 推荐模型 | 基座 | 选型理由与短板 |
|---|---|---|---|
| 自助法律咨询 | 獬豸(LawGPT_zh) | ChatGLM-6B | 训练语料含 20 万条律师问答、法条联想生成的情景问答,回答最贴近真实咨询口吻;短板是 6B 规模,复杂案情下的推理深度有限 |
| 合同条款审查 | LaWGPT | Chinese-Alpaca-Plus-7B | 扩充法律专有词表,并在裁判文书、法考真题、法规库等语料上持续预训练,识别风险条款更稳;短板是显存成本高于 6B 级 |
| 法律文书起草 | ChatLaw-13B | Ziya-LLaMA-13B | 数据覆盖论坛、法条、判例等来源,另配 93 万条判决案例训练的 Text2Vec 模型,能把你的问题匹配到对应法条,写文书时引用有据;短板是 13B 起步,33B 版门槛明显更高 |
补充两点取舍逻辑:
- 先量化,再谈精度。日常咨询先用 6B 级模型配 4bit 量化验证场景,跑通后再决定是否升级到 13B。
- 词表决定识别能力。合同里大量专业术语,LaWGPT 这类做过词表扩充的模型,比只微调对话层的模型更不容易"读不懂条款"。
法律大模型部署:最小可跑通清单
部署不需要多步展开,四步即可跑通:
- 拿到资源仓库:
git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM - 打开 doc/Legal.md,按上面的场景表锁定一个主模型,一个备选模型即可。
- 下载对应模型权重,在单卡 GPU 上以 4bit 量化加载。
- 用一两个真实问题验证输出,再决定是否接入文档解析和法条检索模块。
硬件要求参考:
- 6B 级(量化后):8GB 显存一张卡可跑
- 7B 级(量化后):建议 8GB~12GB
- 13B 级(量化后):建议 16GB 及以上
- 无独显时 CPU 可推理,速度慢,只适合低频查询
从能用到用好:法律 AI 的提问与使用红线
建议:
- 提问带上事实要素:身份、时间、金额、地区加一个明确诉求,例如"我在杭州租房,押一付三,退租时房东扣押金,怎么主张权利",而不是"租房纠纷怎么办"。
- 拆步骤问:先问适用哪条法条,再问我的情况如何认定,最后问下一步该做什么,比一次问完更稳。
- 要求模型给出法条编号和原文,方便你逐条溯源;给不出依据的回答直接降权处理。
不建议:
- 不建议把输出当最终意见直接使用。它适合初筛和打草稿,不能替代律师意见,也不宜直接作为对外文书。
- 不建议照单全收引用。模型可能张冠李戴甚至编造条文,所有法条都要到官方法律法规数据库逐条核实。
- 不建议跨地区套用结论。同一问题在不同省市的执行口径可能不同,涉及诉讼期限、仲裁约定时按当地规定核对。
法律大模型的分层原理:为什么"检索增强"很关键
法律大模型通常是三层结构:底层是通用预训练语言模型,负责语言和基础推理;中间层用法律语料做持续预训练与指令微调,注入法条、裁判文书等专业知识;顶层用检索增强(RAG),把你的问题和法条库、案例库做相似度匹配,把命中的条文拼进提示词再生成回答。好处是答案能指向具体条文、便于核实,法规更新时替换检索库即可,不必重训模型。这一层也是判断一个法律模型"敢不敢引用法条"的关键。
结语
资源仓库负责帮你选模型、跑通最小部署,效果上限取决于提问方式和核实习惯。各模型的基座、数据与许可细节见 doc/Legal.md,部署中遇到问题可以直接在仓库提 Issue 找社区。
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考