星光澄海 | BLOG

FastBench测流式VLMs:高速现实流感知卡壳了?

目前最强的Gemini-3.5-Flash,在FastBench测试里只拿了50.7分——这是当前流式视频大模型(VLM)应对高速现实流感知的上限,连及格线都没摸到。

原有基准的盲区:1-2FPS采样漏了快动作

现有流式VLMs能做连续视频理解,但测试基准全是低动态场景,根本没碰高速流。模型要在有限上下文预算里,平衡时间历史、空间分辨率、时间粒度三者;但稀疏采样1-2FPS的做法,刚好会漏掉快动作——比如现实里乒乓球的快速移动,或者路口车辆的突然变道,模型根本抓不住。这就是FastBench要补的坑:怎么测流式VLMs对高速动态现实流的感知能力。

FastBench的设计:靠轨迹和人工筛出硬题

FastBench的管道全是为了筛出真问题:先从高帧率视频片段生成QA,过滤掉那些2FPS采样下也能答对的水题;再用SAM3和CoTracker3的轨迹验证答案;最后三轮人工检查,确保QA的严谨性。最终FastBench攒了306个QA对,覆盖8个领域、6种能力,还有前向、即时、后向三个时间范围,每个都有人标注的证据区间。另外还做了个训练-free的基线模型ProactiveFrame,靠文本tokens调整输入帧率,用双级滑动窗口留存近期高帧率内容,旧的下采样成稀疏历史。

测试结果暴露短板:模型还不会判断什么时候要细采样

实验结果戳破了现有模型的假象:Gemini-3.5-Flash作为当前最强模型,得分才50.7%。Qwen3-VL-8B涨得最明显,从2FPS的32.9%升到24FPS的44.6%,但到后面就饱和了,再提帧率也没用。ProactiveFrame比均匀采样高5.4和1.5个百分点,但还是远不如oracle引导的聚焦采样——核心问题是,现在的VLMs没法从视频流里自己判断,什么时候需要更精细的时间感知。

FastBench提供了专门测试高速动态流式理解的平台,代码和数据在对应github仓库。现在的流式VLMs,连最强的都没摸到及格线,说明高速现实流的感知,还是行业没解决的痛点。就算靠调整帧率能涨点分,可模型连“什么时候该细采样”都不知道,这道题要怎么解?


素材来源:arXiv (LLM/多模态新论文) · AI情报、AI应用落地、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown