星光澄海 | BLOG

《冻住的多模态大模型,能定位“左边黄香蕉”里的修饰词?》

你让多模态大模型(MLLM)描述图里的水果,它说“左边黄香蕉”,那你知道它是怎么确定“黄”和“左”对应图里哪块区域的吗?之前没人在意这个——大家只盯着“香蕉”的定位,把“黄”“左”这些修饰词当成了无关的噪音。

原来修饰词里藏了定位信息?

这篇arXiv分类为cs.CV的论文,偏要揪这个被忽略的细节:冻住的MLLM里,修饰词(属性、空间、关系这类词)有没有对应的视觉定位信号?毕竟MLLM现在能描述越来越复杂的视觉场景,token级别的定位变得关键,但之前的方法全漏了修饰词。
结果挖出来的信息很有意思:第一,修饰词里能解码出区分实例的视觉信息,空间词(比如“左”“右”)的证据最明显,属性词(比如“黄”“红”)也有;第二,不止修饰词,上下文里的名词(比如“香蕉”)也藏着指涉某一实例的信息——不是只有形容词副词能帮定位,连核心名词都有用。还有两个补充结论:这种定位信号在上下文变化时(比如图里加了别的物体)依然有效,而且用最优传输(OT)的技术能把它挖出来,还能用到自由生成和跨数据集的场景里。

新工具OTTER:把冻住的模型挖透

怎么把冻住的MLLM里的修饰词定位信号挖出来?作者搞了个叫OTTER的工具,是轻量的监督探针——不碰原来的MLLM,只是在它的表示层外面加个小模块,用最优传输的技术,把模型生成的每个词(不管是修饰词还是名词)和图里的区域对齐,最后生成紧凑的定位图。
这个工具的好处很实在:它针对的是“冻住的”MLLM,不用微调原模型,成本低;而且效果不止在控制好的实验场景,随便让模型自由生成描述,或者换别的数据集,它都能用上。也就是说,不是只能在实验室里用,落地的可能性很大。

对模型从业者来说,这意味着什么?

之前的MLLM做视觉定位,只能靠核心名词,比如找“香蕉”就找图里所有香蕉,没法区分“左边的”还是“右边的”。现在有了OTTER,就能精准定位到修饰词对应的区域,这能让多模态交互的精度上一个台阶——比如你对着智能设备说“帮我打开左边黄色的文件夹”,它能真找到对应的那个,不会把右边蓝色的拿来。
而且这补了MLLM的一个短板:大家之前只关注MLLM能说什么,没关注它的生成过程里藏着的细节信息,这些信息能用来做更精准的交互。

现在的问题是,这种修饰词的定位信号,会不会被更大的MLLM自然具备?还是说必须像OTTER这样额外加探针挖出来?毕竟冻住的模型没经过微调,要是未来的大模型自己就能解码这种信号,那多模态应用会不会不用这么麻烦?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、AI基础设施
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown