星光澄海 | BLOG

WOVEN:补上多模态大模型的视觉推理短板

38个顶尖多模态大模型里,没一个能达到人类的视觉推理水平。

多模态大模型的集体硬伤
多模态大模型(MLLMs)在空间、具象化、物理、时间推理上表现极差。研究人员发现这些失效其实指向同一个核心问题:视觉过渡推理能力的缺失。但之前的基准测试是单独记录各类失效,没法在相同场景、动作、推理类型下做可控对比,自然找不到统一的训练方向。

WOVEN:给视觉推理做“标准化训练素材”
为解决这个问题,研究人员推出了WOVEN——一套专门针对视觉过渡推理的训练源和基准。这套系统把视觉过渡监督按场景、动作、推理类型分类,素材来自视频预训练生成模型的实际推演结果,总计36076个例子,覆盖20种场景、5种动作类型、8种推理类型。

训练出的共享能力:跨任务通用
用WOVEN训练不同规模的MLLMs后,研究人员发现学到的视觉过渡能力能跨任务复用。只用约2000个WOVEN例子,就能让26个外部基准里的22个性能提升,最高幅度达27.3个百分点;甚至用WOVEN数据替代对应任务自身训练数据的30%-50%,模型精度仍能持平。研究还总结出一套训练配方:选监督素材时优先看它教的推理操作,而非场景、动作或领域;优先选视觉状态变化大的例子,模型会更稳健。

之前大家总觉得多模态大模型的视觉短板得靠堆更多参数或特定任务数据补,WOVEN的思路是找到了一个可复用的“共享训练基元”,让不同模型都能靠这套素材补能力。那未来,MLLMs的竞争会不会不再单纯拼参数规模,而是谁能搞出更高质量的这类结构化视觉推理训练素材?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown