星光澄海 | BLOG

谁在给大模型出题判卷?AI数据生意的野蛮生长

AfterQuery今年4月A轮融资时估值3亿美元,才过5个月,9月就跳到了32亿——这是AI数据行业最扎眼的数字。这个专门给大模型做训练数据的公司,估值半年翻十倍还多,背后是整个行业的野蛮生长,却对外界极其不透明。

从打标签到造环境:数据生意变了

以前说起AI数据,大家想到的无非是给图片打标签、给模型回答打分的标注。但2024年Deep Search兴起后,行业突然转向“智能体数据”,需求彻底变了。
原来的RLHF(基于人类反馈的强化学习)靠人类喜好打分,现在要的是“可验证的信号”:代码题有明确对错,医疗、金融这类领域的答案不结构化,就需要rubric(专家写好的评分细则)——弱模型拿着规则去改卷,这就是业内说的“弱模型监督强模型”。
但rubric很快不够用了。现在要模型“动手”:比如执行代码任务,得给它工具、沙盒环境,还要验证变量有没有写入、数据库操作是否正确,甚至生成文档里的图都要检查。不是单纯出个文本打分,而是一整套“任务+环境+验证机制”,这才是现在数据公司的核心交付物。

玩家的取舍:从招聘公司到垂直经纪商

做数据的玩家五花八门,基因不同,取舍也不一样:
大玩家比如Scale AI,是传统众包出身,靠质检经验撑着,能cover各种需求;Mercor、Surge AI是招聘起家,有自己的专家网络,能快速找到懂行的人;还有新秀专做合成数据,或者垂直领域——比如好莱坞的人手里有大量版权数据,懂怎么把零散领域的东西打包卖,三五个人的小作坊也能拿到高估值,因为瞄准了垂直缺口。
每个公司都绕不开取舍:全职专家质量高,但产能、灵活度差;众包灵活,但质量难控,得靠质检补。

出题还是刷榜?评测生意的红线

评测和卖数据的关系,是这个行业最微妙的地方。Scale AI推出HLE(人类终极考试),伯克利的ALE项目覆盖55个职业,都是用来测模型能力的。
Scale AI的何允中说,评测是找模型和理想状态的差距,卖数据又和评测绑定——想提升某类能力,得对应评测的方向。但这里有个红线:不能把做评测的数据拿去卖。伯克利的孙一铀私下听说有数据公司踩了这个坑,毁了benchmark的权威性,也坑了所有用数据的模型公司。
刷榜呢?孙一铀觉得不全是坏事:如果刷的是贴近真实需求的题,比如ALE要的是解决职业问题,那刷榜能真的提能力,不是贬义词。

现在AI数据生意还在野蛮生长,估值涨得快,玩家多,门道也杂。怎么在“赚快钱”和“真的帮模型解决问题”之间找平衡?是这个行业现在最没标准答案的问题。


素材来源:钛媒体 · AI情报、融资并购、大模型、AI智能体
查看报道原文

发表第一条评论吧

支持 Markdown