星光澄海 | BLOG

没有标准答案时,用经济学旧招评大模型

去年Vossler团队发表的一项水质价值调查,测了六个大语言模型——两个老模型在家庭年收入7.5万美元的水平上,连最基础的理论测试都通不过,两个最新模型倒是通过了所有理论有效性测试,但在收敛性上出现了分歧。这事儿戳中了大模型评估的核心痛点:现在问LLM的很多问题,根本没有能用来打分的正确答案。

大模型评估的死穴:很多问题没有标准答案

现在抛给大模型的问题,越来越多是这类没标准答案的:某项政策值多少钱,用户该选哪个服务方案,怎么权衡两个冲突的价值观——比如环保和经济增长。这些问题的核心是“价值判断”,没有统一的真实值,原来靠“答对多少题”的评估逻辑,完全用不上。

经济学的老框架,怎么用来评LLM?

陈述偏好经济学这门学科,遇到这类问题已经几十年了。它不用找真实值,而是靠一套“有效性”相关的概念来判断:内容效度、结构效度、效标效度,再加上可靠性、激励相容性、后果性这些指标。这篇论文里,作者把这套框架平移到了大模型评估上,还明确了每个概念对应LLM评估的意思。这次测试用的是Vossler等人2023年的水质陈述偏好调查,测试的核心标准来自经济理论的预测:需求应该是向下倾斜的(价格越高,愿意支付的人越少),支付意愿要对“商品范围”(比如水质改善的程度)和收入水平有反应——这些是经济学里的硬规则,相当于给LLM出了一套没有正确答案但有“合理边界”的题。

测试结果和给行业的提示

六个被测模型的表现被这套标准拉开了差距。两个上线时间较早的模型,在家庭年收入7.5万美元的水平上,连最基础的理论测试都通不过——也就是说,它们对水质改善的支付意愿,不符合需求向下倾斜的基本规律。两个最新的模型则通过了所有理论有效性测试,但在“收敛有效性”(不同测试场景下的表现一致性)上出现了分歧。作者最后补了个关键判断:通过这些有效性测试,只说明模型的回答是连贯的,不代表它的答案是“正确”的。

这套方法的价值,在于给无标准答案场景的评估找了个参考——虽然它没法替代真实值的作用,但至少能区分出哪些模型的回答是符合逻辑一致性的。那问题来了:以后我们选大模型做这类决策类任务,是更看重它的理论一致性,还是收敛性这些细节表现?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI政策与监管
查看报道原文

发表第一条评论吧

支持 Markdown