星光澄海 | BLOG

OmniCapBench:解决多模态模型评测痛点的新框架

你知道现在评测多模态大模型(MLLM)有多挠头吗?要么评分全但找不到具体问题在哪,要么能定位但覆盖不全,用大模型当裁判又容易乱打分。直到OmniCapBench出来——它靠786个精标视频,把评测从“模糊打分”拉到了“可拆解验证”的程度。

当前MLLM评测的“两难”

现在MLLM正快速往连续视听推理发展,评测工具却跟不上节奏。视听字幕是诊断模型能力的理想任务,可现有评测卡了两个死结:一种是全句评分,能覆盖内容,但没法定位模型哪部分感知错了;另一种是局部探针,能精准锁定错误,但覆盖不了全局内容;还有无约束的LLM judge,打分稳定性差,不同 judge 评同一个结果常跑偏。

OmniCapBench的核心设计

这个框架把视听字幕评测重新定义成深度结构化的诊断体系。它把模型要输出的目标,从自由写的文本,改成了三类原子化、可验证的单元:实体引用、视觉镜头、音频事件。打分不靠模糊的文本匹配,而是用确定性的约束检查(比如有没有遗漏实体),再结合本地化的LLM语义对比(比如某段音频和对应实体的关联是否匹配)。它用786个密集标注的视频做支撑,能精准区分模型的感知错误:比如时间定位失败、身份漂移、跨模态不对齐、编造描述这些问题。

给全模态发展的路线图

作者用这个框架评测前沿MLLM,得出了具体结论:这些模型的局部感知能力强,但长时视听推理弱,尤其容易在身份漂移和跨模态对齐上出错。这不是笼统说“模型推理差”,而是把短板细化成了可优化的方向——相当于给全模态模型的发展画了张细粒度的路线图。

这种拆成原子单元的评测,会不会比笼统的打分更能帮模型补上实际的感知漏洞?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown