星光澄海 | BLOG
有点子了,就去执行……
FastBench测流式VLMs:高速现实流感知卡壳了?
目前最强的Gemini-3.5-Flash,在FastBench测试里只拿了50.7分——这是当前流式视频大模型(VLM)应对高速现实流感知的上限,连及格线都没摸到。原有基准的盲区:1-2FPS...
2026-10-08 1 0 人工智能/应用
FastBench: Can Streaming VLMs Perceive High-Dynamic Real-World Streams?
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08文章针对流视频大语言模型(VLMs)现有基准聚焦低动态场景的不足,构建含306个问答...
2026-10-08 1 0 人工智能/应用
统一多模态深度研究Agent OneSearch-VL 做对了什么
OneSearch-VL-8B比带工具调用的Qwen3-VL-8B,在两个新的多模态视觉基准上,分别高出20.2和17.6个百分点。同参数级别的模型,差十几个点已经是很明显的能力差距——这不是小...
2026-10-08 1 0 人工智能/应用
OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本文提出OneSearch-VL,一种基于视觉接地证据图(VGEG)的统一多模态深度...
2026-10-08 1 0 人工智能/应用
WOVEN:补上多模态大模型的视觉推理短板
38个顶尖多模态大模型里,没一个能达到人类的视觉推理水平。多模态大模型的集体硬伤多模态大模型(MLLMs)在空间、具象化、物理、时间推理上表现极差。研究人员发现这些失效其实指向同一个核心问题:视...
2026-10-08 1 0 人工智能/应用
WOVEN: Weaving Visual World Modeling into Multimodal LLMs
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本文针对多模态大语言模型(MLLMs)在空间、物理等推理上的缺陷,提出WOVEN训练...
2026-10-08 1 0 人工智能/应用
GeoReform如何帮大模型搞定几何题?
Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何...
2026-10-08 1 0 人工智能/应用
GeoReform: Reflective Formalization Evolution for Multimodal Geometry Problem Solving
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08这篇arXiv的cs.AI分类文章,针对多模态大模型处理几何问题时的几何关系识别难题...
2026-10-08 1 0 人工智能/应用
大模型说的法律依据,算不算真的依据?
说出来你可能不信:7个从80亿到700亿参数的开源大模型,在法律推理里,说对法条或判例的概率能达到66.7%到100%;但你要是偷偷把它们引用的法条换成不相关的,它们的判决结果能跟着变的比例,最...
2026-10-08 1 0 人工智能/应用
Cited but Not Consulted: A Counterfactual Audit of Legal Chain-of-Thought Faithfulness
AI 情报卡 · 重要性 ★★★☆☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本研究针对大语言模型在法律推理中引用法律依据的忠实性开展反事实审计,发现替换无关法律...
2026-10-08 1 0 人工智能/应用