Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何题的错误,结果反而多出13个新错——这就是几何推理的坑。
之前的解法为啥越改越乱?
多模态大模型搞不定几何题,核心是没法从图里抓准、用对几何关系。之前的思路是把几何实体、关系、约束转成明确文本,喂给模型推理。但形式化这事太麻烦:冗余的关系会干扰模型,对图里元素的指代模糊,会让模型用错约束。刚才那200个例子的情况,就是典型——只想着多提取几何事实,没考虑怎么组织这些事实能帮模型推理,相当于给模型塞了一堆杂乱的零件,本来想补窟窿,结果还掉出来新零件。
GeoReform的核心逻辑是啥?
GeoReform不把形式化当成固定的解析结果,而是当成可以优化的策略。它会走完整个推理流程,收集失败的案例,诊断当前表示里的问题,然后调整策略——比如选哪些几何实体,怎么对应图里的元素,怎么分组,怎么呈现约束和目标。说白了,这就像给模型找了个“复盘+改错”的机制,不是硬塞信息,而是让模型自己优化怎么用这些几何信息。
这对多模态推理有啥用?
在Geometry3K上,给Qwen3VL-2B用了GeoReform,准确率从42%跳到56%,涨了14个点。跨多个几何推理基准的实验都证明,有效的形式化才是提升多模态几何推理的关键。之前大家可能都在拼模型参数,现在发现,怎么把图里的几何信息组织成模型能懂的形式,比单纯堆信息更重要。
这事儿其实给多模态推理提了个醒:很多时候,模型能力够了,但信息的“组织方式”没找对,结果就会差很多。你觉得,把GeoReform这种“动态优化几何信息组织”的思路,用到其他需要多模态推理的场景(比如物理题、工程图分析),会不会也能拿到类似的涨幅?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧