法律大模型进入推理竞争后,怎样验证它真的完成了法律分析?
法律大模型的回答越来越像法律文本,但“写得像”与“完成法律分析”仍是两回事。表达流畅,只能说明文字通顺;检索命中,只能说明找到了相关资料;法律分析则要把事实、争点、规范、证据与结论连起来,并让专业人员能够逐项复核、修改和使用。
法律大模型的回答越来越像法律文本,但“写得像”与“完成法律分析”仍是两回事。表达流畅,只能说明文字通顺;检索命中,只能说明找到了相关资料;法律分析则要把事实、争点、规范、证据与结论连起来,并让专业人员能够逐项复核、修改和使用。
因此,评估模型不能只看答案是否完整、法条是否够多,或案例名称是否相关。更可靠的做法,是把任务拆成几个可检查的环节:事实拆解、争点形成、依据追溯、反方检验和文书落地。使用律页官网中的 AI 对话、资料检索和项目文档时,也可以按这条路径组织工作。
先核对事实:模型究竟读懂了什么
法律分析的起点是材料,而不是结论。面对合同、聊天记录、行政决定或其他文件,应先要求模型区分:
- 材料直接支持的事实;
- 当事人的陈述、主张和推测;
- 尚未核实的时间、主体、金额、行为与结果;
- 可能影响结论、但材料中尚未出现的关键信息。
可以让模型先整理一张事实表,为每项内容标注来源位置、证明状态和可能的相反解释,并单独列出需要补充的问题。这样做比直接要求“判断能否胜诉”更容易发现事实缺口。
在律页 AI 对话中,可以把任务目标、案件材料和限制条件放在同一工作空间,要求系统只使用已经上传并处理成功的文件;无法从材料确认的内容单独列出;对缺失事实提出问题;不要把当事人的评价直接改写成法律事实。AI 对话支持检索和阅读当前会话中的附件,但只有上传或处理成功的文件会参与回答。
随后仍要回到原材料逐项核对。比如,材料只写明“对方未付款”,模型却改写成“对方恶意违约”;材料显示对方收到文件,模型却直接写成“已经完成有效送达”。这类改写即使没有改变故事主线,也可能改变法律判断的前提。法条引用正确,并不能弥补事实基础的错误。
形成争点:找出会改变结论的分歧
材料中出现的所有问题,并不都是法律争点。一个有用的争点,应当能够回答:哪一项事实或规范上的分歧,会改变责任、权利、程序结果或救济方式?
测试模型时,可以要求它分别列出:
- 一方希望法院、机关或相对方接受的结论;
- 对方可能提出的主要抗辩;
- 决定争议走向的事实和法律条件。
例如,围绕一项费用请求,争点可能包括合同是否成立、付款条件是否成就、履行障碍是否可归责、损失与行为之间是否存在因果关系,以及请求金额能否由证据支持。不同争点对应不同证据和依据,不能用“是否应当付款”这样的概括问题全部替代。
律页 AI 对话可以根据任务组合会话附件与资料工具;裁判案例智能检索则支持输入自然语言问题,系统据此生成关键词,并用关键词进行全文检索。检索结果适合用来发现案例线索,但关键词不是争点本身。使用者仍应检查案由、基本事实、诉讼请求和争议焦点是否被正确提炼,必要时删除或调整关键词后重新检索。
不同资料承担的作用也不相同:法律法规用于确认规范,附件用于核对案件材料,实务资料可用于了解办理流程和风险提示,上市公告和联网公开信息用于补充相应的公开资料,范本用于参考文书结构和表达。找到相关资料,不等于已经完成争点分析。
一个简单的检查方法是追问:“如果这个问题的答案相反,最终结论会不会改变?”如果不会,它可能只是背景信息;如果会改变,却没有被列入争点,分析就可能遗漏了关键分歧。
追溯依据:相关来源不等于适用依据
引用法条、案例或其他资料时,至少要核对四点:来源是否存在,引用是否准确,规范在时间和效力上是否适用,以及该来源支持结论中的哪一步。
查看法规时,不能只看标题或搜索摘要。应核对制定机关、颁布日期、实施日期、时效性、效力位阶,以及修改、失效或部分失效依据。对于已经修订的法规,还要比较当前版本与历史版本,确认行为发生时应适用哪个文本。
律页的法规详情支持查看结构化全文、本法变迁、法规对比、法条变迁、关键字定位、文本标记和复制。使用这些功能时,可以建立“结论—具体条文—适用版本”的对应关系,而不是只保存一段没有上下文的引用。
回答中的来源汇总可以帮助定位系统使用了哪些资料,但不能替代人工核对。每项关键判断都应进一步拆开:引用的是定义、构成要件、程序要求、举证规则,还是案例中的个案事实?模型是否把裁判文书中的说理写成普遍规则?是否引用了旧版本条文?是否把范本中的惯常表述误写成法律强制要求?
重要结论应继续打开具体来源。没有来源的内容,不应视为已经完成依据核验;有来源但无法对应具体判断的内容,也只能作为待复核线索。
可以把审查结果整理成四栏:结论、适用条件、依据原文、与案件事实的连接。如果只能填出结论和一条表面相关的法条,却说不清案件事实满足了哪些条件,那么模型完成的可能只是检索或改写,还没有完成法律适用。
做反方检验:主动寻找推翻结论的材料
单向论证容易产生“看起来合理”的答案。复核时,应要求模型主动检验自己的初步判断:
- 最强的相反主张是什么;
- 哪项事实不足会使结论无法成立;
- 是否存在不同案由、程序路径或责任主体;
- 是否有例外规则、特别规定或相反裁判观点;
- 对方可能如何解释同一份证据;
- 如果关键证据被排除,结论是否仍然成立。
阅读案例时,不要只按相同案由或关键词判断相关性。应分别查看相似事实、争点、裁判理由和结果。案例详情中的审理经过、诉请、证据、事实认定、本院认为和裁判结果,承担的功能不同。案由相同,不代表法律关系和关键事实相同;结果相近,也不代表裁判理由相同。
分屏核对有助于发现模型概括与原文之间的偏差。重点检查三种情况:只引用裁判结果,却没有对应事实条件;引用“本院认为”中的一般表述,却忽略案件所处的程序阶段;把一审意见、二审改判理由或再审审查内容混在一起。
反方检验的目的不是让模型替代专业人员判断证据,而是把可能影响结论的争议显式列出来。材料中有一份证据,不等于相关事实已经被证明;模型可以提出核查问题和可能解释,但不能替代对证据真实性、合法性、关联性和证明力的判断。
落到文书:检查分析能否继续使用
法律分析是否完成,最终要看能否转化为可审阅的工作成果,而不是看聊天窗口中的文字是否漂亮。可以要求输出以下内容:
- 任务范围和待解决问题;
- 已确认事实、待核实事实与事实缺口;
- 争点及相反主张;
- 每个争点对应的规则、适用条件和依据;
- 事实与法律要件的逐项对应;
- 风险、不确定性和补证建议;
- 可选择的处理路径及其前提;
- 需要人工确认、签署或进一步调查的事项。
律页支持将法律法规、裁判案例和文书模板检索结果转换为文档,并选择保存到个人或团队项目。法规以分段格式保存;裁判案例可选择分段格式或原文格式;文档中的法规或案例标题支持跳转到对应详情。格式转换解决的是保存、整理和继续编辑的问题,不会自动完成事实归纳或法律论证。
在项目文档中边写边问,可以先形成事实与争点表,再补入依据和反方意见,最后整理成团队继续编辑的文档。检索结果、文档和对话之间形成工作衔接后,每次修改仍应检查事实是否改变、依据是否对应、争点是否得到回应。
一个有效的文书测试是:删掉模型写出的结论,只看事实、依据和要件对应,读者能否理解结论从何而来?每个重要判断能否回到材料或具体来源?是否明确区分了法律要求、案件事实、推测风险和工作建议?如果不能,输出仍然是叙述性文本,而不是可复核的工作底稿。
用验收表代替第一印象
法律大模型应按任务验收,而不是按单次回答的流畅程度评价。至少可以记录:
- 事实准确性:是否遗漏、增补或改写关键事实;
- 争点完整性:是否覆盖会改变结论的核心分歧;
- 依据可追溯性:法条、案例和资料能否定位核对;
- 规范适用性:是否考虑时间、效力、适用条件和例外;
- 反方充分性:是否提出有实际影响的相反路径;
- 证据边界:是否混淆材料存在、事实成立和证明力;
- 文书可用性:结构、引用、链接和待办事项是否便于继续工作。
重新生成或切换模型,可以用于比较不同版本,但版本更多不等于结论更正确。应比较的是事实是否稳定、争点是否变化、依据是否一致、反方是否得到回应。
判断模型是否真的完成了法律分析,可以归结为一个标准:它是否把材料、争点、规范、证据、反方和文书连接成可回溯的链条,并允许专业人员在每个节点核对和纠错。语言流畅降低的是阅读成本,检索命中缩短的是找资料的时间;经过拆解、核对、质疑和落地,输出才具备进入法律工作流程的基础。
内容治理与纠错
我们持续核对并维护公开内容。若你发现事实、链接或表述需要核对,请向我们反馈。