LMArena背后的公司刚拿到2亿美元融资,领投方是Lightspeed和Khosla。更扎眼的是估值——过去10个月里,它从约15.5亿美元涨到了31亿,几乎翻了一倍。
不是吹估值,是赛道真的变了
以前看AI排行榜,跟看手机参数似的,比的都是模型的硬实力:准确率够不够?代码写得快不快?生成内容的质量高不高?但这次估值翻倍,核心不是流量涨了多少,是LMArena的测试方向变了——他们现在把“对齐”当成了核心指标,其中就包括测AI会不会撒谎。
这事儿有点意思。之前大家都觉得,AI只要够聪明就行,会不会撒谎是小问题,大不了事后修正。但最近一年,模型幻觉、故意输出虚假内容的事没少爆,从ToC的聊天助手到ToB的企业应用,靠谱性成了绕不开的坎。风投愿意给这么高的估值,本质是看到了这个方向的价值——LMArena没在卷参数,而是卷“AI能不能信”,这刚好踩中了行业的痛点。
他们的测试,已经戳中了行业的痒处
什么是对齐?简单说,就是AI的行为符合人类的期望。以前LMArena的榜单,可能还在比谁的模型能解数学题、能写论文,现在不一样了——他们会设计专门的测试题,看AI会不会在被问“这个问题的答案是什么”时,故意编造数据;会不会在用户要求“说实话”的时候,回避真实信息。
对开发者来说,这等于给模型定了新的KPI。以前训练模型,优化目标是“尽可能答对”,现在得加上“尽可能不撒谎”。对用户来说,以后看AI排行榜,除了看能力,还要看“是不是靠谱”。这不是锦上添花的小事,是整个AI行业从“能用”到“敢用”的转折点——毕竟没人敢把一个会撒谎的AI放进核心业务里。
接下来的问题,谁会跟上?
现在LMArena的估值涨得快,其他做AI评测的机构会不会眼红?会不会也把对齐测试加到自己的榜单里?我觉得大概率会。毕竟,当风投都把“对齐”当成核心竞争力,开发者和用户自然会跟着重视。
从另一个角度看,这也说明AI行业的竞争已经从“谁造得出”转向“谁造得靠谱”。以前是抢参数、抢模型大小,现在抢的是“怎么让AI听人话、不说谎”。
最后留个问题:再过10个月,LMArena会不会又要加新的测试维度?比如AI会不会“敷衍”用户的提问,还是真的在认真思考?
素材来源:TechCrunch AI · AI情报、融资并购
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧