有点子了,就去执行……
OpenAI的数学证明为何没达到行业标准
最近OpenAI推的一批数学证明工具,刚露面就被他们自己咨询过的数学研究小组盯上了——这些工具生成的大量证明,全偏离了当初顾问们定的行业指南。不是翻车,是没守约定的规则OpenAI为了做数学证明...
OmniCapBench:解决多模态模型评测痛点的新框架
你知道现在评测多模态大模型(MLLM)有多挠头吗?要么评分全但找不到具体问题在哪,要么能定位但覆盖不全,用大模型当裁判又容易乱打分。直到OmniCapBench出来——它靠786个精标视频,把评...
SpatialHarness补了GPT-6 Astra精细操作的空间短板
给GPT-6 Astra的插针测试,之前成功率才26.7%,用SpatialHarness一上,直接飙到66.7%——汉诺塔更是从0变100%。这不是游戏,是arXiv cs.RO分类里一篇机器...
给多智能体加个“读心术”:新框架补了协作短板
你可能没注意——现在靠大模型驱动的智能体组队干活,大多是“盲打”状态。普通多智能体的协作硬伤之前的多智能体系统,靠提示词设计、短期记忆或者端到端行为优化推进任务。但核心问题很致命:不会显式建模队...
「Bi-FORK:让AI突破高维分叉系统生成建模限制」
当深度学习模型处理的物理系统被离散成26万个点时,之前能应对分叉的模型基本要瘫掉——直到arXiv上的一篇论文带来了Bi-FORK。分叉系统,AI没摸透的物理难题。分叉在物理里太常见了:结构受压...
今日美国起诉OpenAI侵权 索赔超2.5亿美元
本周四,《今日美国》及其旗下多家地方报向法院提交诉状,状告OpenAI未经授权使用其“数十万篇”文章训练AI模型,索赔金额超过2.5亿美元。诉状里称,OpenAI的侵权行为已对这些报纸造成“真实...
扩散模型的控制级不确定性:SCOPE解决采样成本痛点
机器人做实时路径规划时,用扩散模型生成轨迹,之前算不确定性要靠蒙特卡洛采样,这一步慢到跟不上毫秒级的控制需求。原来的问题:扩散模型的不确定性太“贵”扩散模型能表示复杂多变的多模态轨迹分布,但要从...
SpaceXAI给有争议的Omarchy Linux发版投150万美元算力
150万美元的Grok代币,是SpaceXAI砸给争议Linux发行版Omarchy的第一笔公开大额赞助。官宣的核心信息今天的消息说穿了是两个实打实的动作。第一,SpaceXAI正式加入Omac...
FastBench测流式VLMs:高速现实流感知卡壳了?
目前最强的Gemini-3.5-Flash,在FastBench测试里只拿了50.7分——这是当前流式视频大模型(VLM)应对高速现实流感知的上限,连及格线都没摸到。原有基准的盲区:1-2FPS...
统一多模态深度研究Agent OneSearch-VL 做对了什么
OneSearch-VL-8B比带工具调用的Qwen3-VL-8B,在两个新的多模态视觉基准上,分别高出20.2和17.6个百分点。同参数级别的模型,差十几个点已经是很明显的能力差距——这不是小...
