星光澄海 | BLOG

From What to Which: Decoding Modifier Grounding in Frozen MLLMs

AI 情报卡 · 重要性 ★★★☆☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08

本文聚焦多模态大语言模型(MLLMs)的修饰词grounding问题,提出轻量级监督探针OTTER,借助最优传输对齐生成token与视觉区域。研究发现冻结MLLM的表示中可解码出修饰词等token的实例区分信息,该方法可迁移至自由生成与跨数据集场景。

标签:AI情报、大模型、AI应用落地、AI基础设施

查看原文


由 WeValue AI 产业情报引擎自动同步

发表第一条评论吧

支持 Markdown