星光澄海 | BLOG

大模型合规系统:判决居然不关规则事?

我最近看到arXiv上cs分类的一组测试,挺颠覆预期的:5款大模型,20个监管规则域,固定案例改规则,结果判决变化不大。

测试的逻辑:反向戳破“规则决定判决”的假设

合规系统默认的逻辑是“给什么规则,出什么判决”,模型得严格按规则来。这次测试反着来:固定同一个案例,只改它对应的规则——要么删掉,要么换掉,要么直接否定规则本身。然后盯两个指标:一是判决有没有变(叫OCS),二是模型内部对这个案例的合规判断表示有没有变(叫ICS-delta)。

核心结果:规则改了,判决几乎纹丝不动

大部分测试场景里,模型的判决对规则的大幅调整都不敏感。尤其那个专门做合规的guard模型,表现垫底:对规则扰动最不敏感,准确率才51%——比通用大模型的90%-92%低太多,刚比瞎蒙强一点。

不是敷衍,是“挑简单的变”

有人可能会说:模型根本不鸟规则!但测试里明确说,不全是这么回事。这是“挑简单的案例”:那些删了规则会改变之前正确判决的案例,模型还是能跟上规则变化的。而且,不管换更好的prompt,还是直接干预模型内部的表示,都补不上这个准确率差距。

行业的小危机:准确率不能当合规的凭证

关键问题在这:只看准确率,没法证明合规判决是真的基于给定规则的。也就是说,你以为合规模型是按规则判的,其实它可能靠训练时学的隐含模式,不是真的理解规则本身。

你们接触过的大模型合规工具,改改规则就变判决的情况,有没有出现过?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI政策与监管、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown