法律大模型怎么选三款开源中文法律 AI 的选型与部署实战【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLMAwesome-Chinese-LLM 是一个开源中文法律大模型资源仓库把獬豸、LaWGPT、ChatLaw 等一批法律 LLM 的基座、训练数据和部署方式整理在一处。本文面向不想支付高咨询费、只想自己跑通中文法律 AI 的普通用户直接给选型结论和最小部署方案。按场景选法律大模型而不是按参数选选法律大模型先看你要干什么再看模型多大。下面三个最常见的场景各给一个取舍最清晰的候选事实依据均来自仓库 doc/Legal.md使用场景推荐模型基座选型理由与短板自助法律咨询獬豸LawGPT_zhChatGLM-6B训练语料含 20 万条律师问答、法条联想生成的情景问答回答最贴近真实咨询口吻短板是 6B 规模复杂案情下的推理深度有限合同条款审查LaWGPTChinese-Alpaca-Plus-7B扩充法律专有词表并在裁判文书、法考真题、法规库等语料上持续预训练识别风险条款更稳短板是显存成本高于 6B 级法律文书起草ChatLaw-13BZiya-LLaMA-13B数据覆盖论坛、法条、判例等来源另配 93 万条判决案例训练的 Text2Vec 模型能把你的问题匹配到对应法条写文书时引用有据短板是 13B 起步33B 版门槛明显更高补充两点取舍逻辑先量化再谈精度。日常咨询先用 6B 级模型配 4bit 量化验证场景跑通后再决定是否升级到 13B。词表决定识别能力。合同里大量专业术语LaWGPT 这类做过词表扩充的模型比只微调对话层的模型更不容易读不懂条款。法律大模型部署最小可跑通清单部署不需要多步展开四步即可跑通拿到资源仓库git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM打开 doc/Legal.md按上面的场景表锁定一个主模型一个备选模型即可。下载对应模型权重在单卡 GPU 上以 4bit 量化加载。用一两个真实问题验证输出再决定是否接入文档解析和法条检索模块。硬件要求参考6B 级量化后8GB 显存一张卡可跑7B 级量化后建议 8GB12GB13B 级量化后建议 16GB 及以上无独显时 CPU 可推理速度慢只适合低频查询从能用到用好法律 AI 的提问与使用红线建议提问带上事实要素身份、时间、金额、地区加一个明确诉求例如我在杭州租房押一付三退租时房东扣押金怎么主张权利而不是租房纠纷怎么办。拆步骤问先问适用哪条法条再问我的情况如何认定最后问下一步该做什么比一次问完更稳。要求模型给出法条编号和原文方便你逐条溯源给不出依据的回答直接降权处理。不建议不建议把输出当最终意见直接使用。它适合初筛和打草稿不能替代律师意见也不宜直接作为对外文书。不建议照单全收引用。模型可能张冠李戴甚至编造条文所有法条都要到官方法律法规数据库逐条核实。不建议跨地区套用结论。同一问题在不同省市的执行口径可能不同涉及诉讼期限、仲裁约定时按当地规定核对。法律大模型的分层原理为什么检索增强很关键法律大模型通常是三层结构底层是通用预训练语言模型负责语言和基础推理中间层用法律语料做持续预训练与指令微调注入法条、裁判文书等专业知识顶层用检索增强RAG把你的问题和法条库、案例库做相似度匹配把命中的条文拼进提示词再生成回答。好处是答案能指向具体条文、便于核实法规更新时替换检索库即可不必重训模型。这一层也是判断一个法律模型敢不敢引用法条的关键。结语资源仓库负责帮你选模型、跑通最小部署效果上限取决于提问方式和核实习惯。各模型的基座、数据与许可细节见 doc/Legal.md部署中遇到问题可以直接在仓库提 Issue 找社区。【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考