星光澄海 | BLOG

WOVEN: Weaving Visual World Modeling into Multimodal LLMs

AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08

本文针对多模态大语言模型(MLLMs)在空间、物理等推理上的缺陷,提出WOVEN训练源与基准,含3.6万多示例。评估发现前沿MLLMs存在系统性缺陷,用WOVEN训练后模型可提升26个外部基准中22个的表现,还得出视觉世界建模的训练方法。

标签:AI情报、大模型、科研前沿

查看原文


由 WeValue AI 产业情报引擎自动同步

发表第一条评论吧

支持 Markdown