说出来你可能不信:7个从80亿到700亿参数的开源大模型,在法律推理里,说对法条或判例的概率能达到66.7%到100%;但你要是偷偷把它们引用的法条换成不相关的,它们的判决结果能跟着变的比例,最多才76.7%,最少的CaseHOLD数据集里甚至只有0%到21.7%。
引用得对,判决未必跟得上
这个实验的逻辑很简单:固定案例事实,只换模型要引用的法律依据,再看模型的判决会不会跟着变。结果戳破了一个常见错觉——我们总把大模型说出来的法条或判例,当成它“按法判决”的证据,但实际情况是,模型的引用准确率很高,可判决根本不依赖这个依据。不同数据集的表现差很大:CaseHOLD里换了法条,判决几乎不动;ECHR和SCOTUS数据集里,有三成到七成的判决会变;ContractNLI里接近五成会变。
规模和定制模型都填不上的坑
你别以为把模型做大,或者专门训练过法律,就能解决这个问题。实验里覆盖了从8B到70B的全规模开源模型,还做了一个专门的法律推理微调模型(用LoRA复现的),结果发现,不管模型大小,还是定制化程度,都没缩小“引用对但判决不依赖”的 gap。也就是说,这不是模型能力不够的问题,是这类大模型在法律推理上的本质缺陷。
还有个更扎心的发现
实验还做了红队测试:在案例里藏一个对抗性指令,看模型会不会遵从。结果是,模型对这个隐藏指令的遵从率高达73.3%到96.4%,比它对换法条后的判决敏感度高太多,而且所有模型都是这个规律,没有例外。这意味着,大模型更在意“听话”,而不是真的用法律依据来做决策——它会精准说对法条,但要它按法条改判决,门都没有。
这事儿最值得琢磨的是,我们之前把模型输出的法律解释,当成合规或审计的依据,但现在看,这更像个标准化表演:只要说的话“像那么回事”,判决怎么定全看它自己的逻辑。那以后用大模型做法律辅助,到底是要它“说对法条”,还是要它“真的用法条影响判决”?
素材来源:arXiv (LLM/多模态新论文) · AI情报、AI政策与监管、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧