星光澄海 | BLOG

DVD解码方案:解决多模态大模型感知的效率痛点

在RefCOCO、KITTI、nuScenes等多模态感知基准测试里,一个叫DVD的新解码方案,让多模态大模型(MLLM)在2D和3D感知任务上,既提升了性能,又砍了token开销、降了推理延迟。

旧方案的两个硬伤

现在MLLM做感知任务,普遍卡在两个问题上。要么依赖文本形式的坐标表示——比如描述边界框的“左上角x、y,右下角x、y”,这种文本转成token后占的空间太大,拖慢处理;要么用固定范围的量化,比如把数值压缩到0-255的区间。
说白了,这俩方案都顾此失彼。尤其遇到3D场景,空间范围是无边界的,还要求高精度定位,固定量化要么范围不够,要么精度达不到要求,等于卡脖子。

DVD的解法:统一框架降本

DVD的思路是,给2D和3D感知做统一的“编码-解码”处理。不管是2D的边界框、掩码,还是3D的边界框,先把这些多样化的感知表示转换成1D的向量序列,再映射成高维空间里紧凑的离散token,最后加一个轻量的解token器,就能把MLLM输出的token,转回到原来的2D、3D感知格式。
这样一套下来,2D和3D任务都能适配,不用分开做两套方案,省了不少折腾。

实际效果:性能效率双升

从实验数据看,这套方案真的管用。在RefCOCO系列、SUN-RGBD、KITTI、Hypersim、nuScenes这些常用的感知基准测试里,DVD的2D和3D任务性能都比现有方案好,同时token开销和推理延迟都明显降了。
相当于给MLLM加感知能力,不用再牺牲效率换性能,或者牺牲性能换效率。对那些要把MLLM落地到机器人、自动驾驶的团队来说,这省下来的延迟和算力,直接能决定产品能不能用。

这套方案目前是arXiv上的预印研究,还没落地,但它解决的问题其实戳中了行业刚需——这些落地场景对MLLM的感知效率要求特别高,延迟高了根本没法实时处理。只是,这套DVD方案会不会成为未来MLLM做感知的标配?毕竟多模态大模型的感知能力,现在还是不少垂直场景的瓶颈,找到这么个通用又高效的路子,会不会很快被行业跟进?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI基础设施、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown