有点子了,就去执行……
给多智能体加个“读心术”:新框架补了协作短板
你可能没注意——现在靠大模型驱动的智能体组队干活,大多是“盲打”状态。普通多智能体的协作硬伤之前的多智能体系统,靠提示词设计、短期记忆或者端到端行为优化推进任务。但核心问题很致命:不会显式建模队...
Mental-Models for Multi-Agent Systems
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本文针对多智能体系统中智能体缺乏显式伙伴状态表示的问题,提出心智模型智能体框架,学习...
统一多模态深度研究Agent OneSearch-VL 做对了什么
OneSearch-VL-8B比带工具调用的Qwen3-VL-8B,在两个新的多模态视觉基准上,分别高出20.2和17.6个百分点。同参数级别的模型,差十几个点已经是很明显的能力差距——这不是小...
OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本文提出OneSearch-VL,一种基于视觉接地证据图(VGEG)的统一多模态深度...
WOVEN:补上多模态大模型的视觉推理短板
38个顶尖多模态大模型里,没一个能达到人类的视觉推理水平。多模态大模型的集体硬伤多模态大模型(MLLMs)在空间、具象化、物理、时间推理上表现极差。研究人员发现这些失效其实指向同一个核心问题:视...
WOVEN: Weaving Visual World Modeling into Multimodal LLMs
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08本文针对多模态大语言模型(MLLMs)在空间、物理等推理上的缺陷,提出WOVEN训练...
HRIL用高阶张量抓多模态协同:比现有方法强在哪?
多模态自监督学习已经在好多场景出成果了,但有个死穴:有些任务需要的信号,单看某一个模态根本找不到。比如一张图配一句“猫在追老鼠”,“追”这个动作的核心信号,得同时看猫的身体姿态和老鼠的位置,单拿...
HRIL: Learning Multimodal Synergy via Higher-Order Tensor Modeling
AI 情报卡 · 重要性 ★★★☆☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08针对自监督多模态表示学习中跨模态协同信息难以捕捉的挑战,本文提出HRIL方法,通过构...
GeoReform如何帮大模型搞定几何题?
Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何...
GeoReform: Reflective Formalization Evolution for Multimodal Geometry Problem Solving
AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08这篇arXiv的cs.AI分类文章,针对多模态大模型处理几何问题时的几何关系识别难题...
