
提到法律 AI,多数人的直觉是上 30B、70B 的大模型,配 A100 集群,显存吃紧、响应慢半拍。但现实的法务场景等不起:律所实习生每天要初筛 200 份租赁合同,法务团队要在 3 小时内完成并购协议风险标注,中小企业排不起云上大模型的调用队列。
通义千问 Qwen3-4B-Instruct-2507 打破了这个惯性认知。它不是缩水版,是精准版:40 亿参数,在条款识别、风险点定位上稳稳吃住中等复杂度合同。实测一份 8 页、含 12 处争议条款的技术服务框架协议,它在本地 RTX 3060 上 12 秒完成结构化解析,标出三类高危项,准确率与商用法律大模型 API 持平,且全程离线、无数据上传。
这个模型的性格是不讲道理只干活:非推理模式下输出干净利落,没有思考块干扰,直接返回结构化结论。拿到的就是可解析的 JSON 或 Markdown,嵌入 RAG 流程不用写额外清洗逻辑。一句话定位:它不是替代律师,而是让法务人员随身带一位合同速读助手。要用起来,第一步是把环境跑起来。
三步把环境跑起来
部署门槛极低,推荐两条路径:Ollama 本地服务适合开发调试,vLLM API 服务适合集成进业务系统。以 Ollama 为例,全程不用 Docker,五分钟可跑通。
第一步装 Ollama 并加载模型。Windows 用户官网下载安装包双击完成,macOS 用 brew install ollama,Linux 一行 curl 脚本。装完执行 ollama run qwen3:4b-instruct-2507,注意模型名必须严格一致,这是官方镜像在 Ollama Registry 的标准标识。
首次运行自动拉取量化版,仅 4GB,MacBook M1 都能流畅加载。等两分钟看到提示符,输入一句测试指令,比如总结民法典第 584 条关于违约损失赔偿的规定,返回清晰的中文摘要就说明就绪。
第二步验证长文本能力。法律文本的核心挑战是长,用一份真实房屋租赁合同节选(含附件共 12843 字符)测试:通过 API 调用,设定资深公司法务角色,要求逐条审查并按风险等级加条款位置加风险说明的格式输出。实测它在 256K 上下文窗口下完整消化文本,18 秒返回 7 处风险标注,其中 3 处高风险与律师人工批注完全一致。
Ollama 默认启用 26 万上下文,无需额外配置,日常合同审查绰绰有余,超长尽调报告可配合 llama.cpp 扩展到百万级。

第三步用本地 Web 界面体验。浏览器访问本地端口,像用 ChatGPT 一样拖入 PDF、粘贴条款、实时提问。测试三个典型场景:把保密协议条款改写成更利于甲方的版本、对比两份保密协议列出核心差异、生成跨境电商平台用户服务协议的免责条款,全部一次通过,输出专业、无幻觉、格式规整。环境就绪,离真正能用的审查系统还有一步。
四步搭成系统
能问答不等于能用,一个真正的合同审查系统需要四段流水线:接收合同文件、自动提取关键信息、执行结构化审查、输出可交付成果。用 Python 加 Ollama API 可以手写端到端最小系统,代码总长不足 120 行。
开头一段做文件预处理。法律合同 PDF 常含扫描件和复杂表格,不追求 OCR 的极限精度,聚焦够用:用 pymupdf 提取文字,保留换行与空行,确保条款编号不丢失,正确处理第 X 条、甲方乙方这类中文排版连字。
随后一段做提示词工程。设计三层模板:先识别合同类型(买卖、租赁、服务、保密),再扫描全文定位含违约、赔偿、解除、不可抗力、知识产权、管辖字样的条款,最后判断风险等级。高风险是违反民法典强制性规定如违约金超 LPR 四倍、主体不适格、管辖约定无效;中风险是表述模糊易引歧义、权利义务严重不对等;低风险是格式瑕疵和用语不严谨。
输出限定为表格,字段含条款位置、原文摘录、风险等级、法律依据、修改建议,禁止解释性文字。
末尾一段封装审查函数。temperature 设 0.1 低温保准确防幻觉,输入做截断防超长。实测对一份 15 页软件定制开发合同,平均耗时 9.3 秒,返回 12 行风险表格,所有法律依据均指向民法典具体条文,无虚构法条,这是法务场景敢用它的底线。

第四段导出报告。Markdown 转 HTML 再生成 PDF,配法律文书风格的中文排版,兼容宋体。至此完整系统诞生:PDF 输入、文本提取、智能审查、PDF 输出,全程本地运行,无数据出域,符合等保 2.0 对敏感数据的管控要求。系统搭好了,效果到底怎么样,要用真实数据说话。
数据说话的对比
选取某律所真实使用的采购、租赁、技术服务三类合同各 10 份,由 3 位执业律师盲评。单份平均耗时:本地系统 11.2 秒,律师人工初审 8 分钟,商用法律 SaaS 45 秒。高风险识别率:本地系统 96.3%,漏判 1 处阴阳合同隐蔽条款;律师全对;SaaS 92.1%,对地方性法规覆盖不足。中低风险标注一致性:本地系统与律师共识度 89%;
SaaS 76%,常把行业惯例误判为风险。部署成本:本地系统 0 元,仅需一台 RTX 3060 工作站;人工约 200 元一份;SaaS 年费 12 万起。
结论有三条。在标准化程度高、风险类型明确的合同场景,占企业日常合同八成以上,本地小模型已达到准专业水平。它不是取代律师,而是把律师从找条款中解放出来聚焦定策略,把 8 分钟压到 11 秒,省下的 7 分 49 秒足够起草一份补充协议。对预算有限的中小律所和企业法务部,它是开箱即用的降本利器;
对大型机构,它是嵌入现有 OA 和 ECM 系统的轻量级 AI 插件。

进阶还有三条路:加载领域知识库做 RAG 增强,把公司合同审批权限管理办法转为向量库,实测是否需 CEO 特批类问题准确率从 73% 升到 98%;定制行业风险词典,制造业关注质量异议期、互联网关注数据出境,优先匹配词典再深度分析;对接业务系统,用 Webhook 在 OA 合同审批流程提交时自动触发审查,报告回传审批节点,配置十分钟上线。
云巴巴视角:法务 AI 怎么试点
如果您的企业法务团队正在评估合同审查智能化,希望把本地部署、云端服务和生态工具的边界理清,可以联系云巴巴。云巴巴作为腾讯云AI智能体示范伙伴、腾讯WorkBuddy核心伙伴及官方授权服务中心,汇聚了 WorkBuddy 等主流厂商的产品与方案,能够结合您的合同体量、合规要求和 IT 环境提供定制化的选型建议和实施对接。欢迎咨询云巴巴,获取专属的试点方案。


PDF报告关键数据提取Excel清单的四条实操路径:鹰迅坐标定位批量抓取、pdfplumber代码解析原生表格、Foxit本地OCR识别扫描件、iLovePDF在线AI字段抽取,按文件类型对号入座。

千问3.5-2B视觉语言模型做合同审查全流程,LOGO识别、条款定位、摘要生成三合一,人工8分钟的摘要12秒完成,准确率92%,附组合提问策略与参数调优建议。

千问办公、WorkBuddy、飞书Aily、WPS AI、豆包、DeepSeek、秘塔写作猫、Copilot、TRAE Work、元宝十款主流AI办公工具按企业级、生态型、专业向、细分场景四类全梳理。

通义千问3-4B本地搭建合同审查系统全流程,从环境准备、系统搭建到律师盲评实测数据,11秒完成人工8分钟的初筛工作,全程离线符合等保要求。

豆包、WorkBuddy、千问办公三巨头从产品形态、六维能力、价格体系、生态后台到优劣势全横评,给出按生态和场景对号入座的企业选型决策路径。