星光澄海 | BLOG
有点子了,就去执行……
FastBench测流式VLMs:高速现实流感知卡壳了?
目前最强的Gemini-3.5-Flash,在FastBench测试里只拿了50.7分——这是当前流式视频大模型(VLM)应对高速现实流感知的上限,连及格线都没摸到。原有基准的盲区:1-2FPS...
2026-10-08 1 0 人工智能/应用
FastBench: Can Streaming VLMs Perceive High-Dynamic Real-World Streams?
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08文章针对流视频大语言模型(VLMs)现有基准聚焦低动态场景的不足,构建含306个问答...
2026-10-08 1 0 人工智能/应用
统一多模态深度研究Agent OneSearch-VL 做对了什么
OneSearch-VL-8B比带工具调用的Qwen3-VL-8B,在两个新的多模态视觉基准上,分别高出20.2和17.6个百分点。同参数级别的模型,差十几个点已经是很明显的能力差距——这不是小...
2026-10-08 1 0 人工智能/应用
OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本文提出OneSearch-VL,一种基于视觉接地证据图(VGEG)的统一多模态深度...
2026-10-08 1 0 人工智能/应用
WOVEN:补上多模态大模型的视觉推理短板
38个顶尖多模态大模型里,没一个能达到人类的视觉推理水平。多模态大模型的集体硬伤多模态大模型(MLLMs)在空间、具象化、物理、时间推理上表现极差。研究人员发现这些失效其实指向同一个核心问题:视...
2026-10-08 1 0 人工智能/应用
WOVEN: Weaving Visual World Modeling into Multimodal LLMs
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本文针对多模态大语言模型(MLLMs)在空间、物理等推理上的缺陷,提出WOVEN训练...
2026-10-08 1 0 人工智能/应用
HRIL用高阶张量抓多模态协同:比现有方法强在哪?
多模态自监督学习已经在好多场景出成果了,但有个死穴:有些任务需要的信号,单看某一个模态根本找不到。比如一张图配一句“猫在追老鼠”,“追”这个动作的核心信号,得同时看猫的身体姿态和老鼠的位置,单拿...
2026-10-08 1 0 人工智能/应用
HRIL: Learning Multimodal Synergy via Higher-Order Tensor Modeling
AI 情报卡 · 重要性 ★★★☆☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08针对自监督多模态表示学习中跨模态协同信息难以捕捉的挑战,本文提出HRIL方法,通过构...
2026-10-08 1 0 人工智能/应用
GeoReform如何帮大模型搞定几何题?
Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何...
2026-10-08 1 0 人工智能/应用
GeoReform: Reflective Formalization Evolution for Multimodal Geometry Problem Solving
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08这篇arXiv的cs.AI分类文章,针对多模态大模型处理几何问题时的几何关系识别难题...
2026-10-08 1 0 人工智能/应用