2861个来自17家商业平台的真实UI生产设计,97652条专家标注,这是刚在arXiv公开的TaoD2C-Bench基准数据集的全部家底——它专门测多模态大模型(MLLM)的UI代码生成能力,而且不止看“视觉像不像”。
为什么要做这个基准?
现在聊MLLM的视觉理解,总有人说“天花板高”,但工业里的UI代码生成,根本不是比谁画得像。你把设计图转成可运行的前端代码,要对应杂乱的图层元数据,要懂组件归属、布局规则,还要符合目标前端库的约束——这些才是工业场景的硬标准。之前没人给MLLM做过这种真实工业场景的测试,大多用实验室级的干净数据,结果就是很多模型视觉还原度拉满,一到真实项目里写代码,就漏了组件对齐、位置约束这类核心要求,所以才缺这么个统一的 benchmark。
它测什么?结果怎么样?
TaoD2C的数据集分四类标注:组件、分组、对齐、位置,特意区分了“必须满足”的硬约束(比如按钮必须在导航栏左侧)和“可选”的实现细节(比如用#FF0000还是#D93025做按钮颜色)。要测的任务有三个:端到端生成UI代码、推理设计里的隐性需求、把需求落地成符合规则的代码。研究人员测了8款主流MLLM,差距大得离谱:有的模型视觉重构能力排前二,但生成的代码连基本的模块对齐要求都达不到。说白了,之前很多模型吹的“多模态能力”,只是能看懂图,离“按工业规矩生产可用代码”还差得远。
对行业来说,这是啥信号?
不管是做MLLM的团队,还是用模型生成UI的企业,这下有了统一的“工业考卷”。之前大家各用各的小数据集,对比出来的结果没参考性,现在用TaoD2C-Bench测,谁真能打,谁只是凑数,一目了然。比如你是给企业做UI生成工具的,不用再死磕怎么提升视觉还原度,得补的是“懂工业规则”的能力——比如某个表单的必填项标签要对齐到输入框的左侧,像素差不能超过2px,这些才是甲方要的“能用”,不是“看着像”的花架子。
如果后续有模型能在这个benchmark上拿到80分以上,你觉得它能直接塞进B端的UI设计工作流里吗?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、科研前沿
查看报道原文

发表第一条评论吧