给GPT-6 Astra的插针测试,之前成功率才26.7%,用SpatialHarness一上,直接飙到66.7%——汉诺塔更是从0变100%。这不是游戏,是arXiv cs.RO分类里一篇机器人相关论文的实测数据。
为啥GPT-6 Astra做不好精细操作?
别以为是GPT-6 Astra能力不行。这篇论文的作者说,核心问题不在模型的策略本身,而在空间感知:现有物理相机的布置,没法把任务里关键的空间关系清晰呈现给模型。比如插针时,针和孔的微小错位,相机拍的图里不够突出;汉诺塔要把块放到指定杆上,相对位置的细微差别,模型抓不住。之前大家总盯着模型的能力,忽略了感知环节的信息漏损。
SpatialHarness的门道在哪?
SpatialHarness是一种测试时用的具身脚手架,巧就巧在不用对GPT-6 Astra做任何微调,也不用改现有的物理传感setup。它的核心逻辑是:在线维护一个和真实世界实时同步的虚拟场景,在虚拟里找出任务必须的空间关联,然后生成互补的虚拟视角,推给已经冻住的多模态模型。为了保证虚拟场景和真实世界对齐,还搞了交互感知同步——能区分静态、手持、过渡三种模式,跟着机器人的动作动态调整,不会跑偏。
团队在四个真实机器人任务上测了:精准几何对齐、物体相对放置、关节物体交互。用同一个冻住的GPT-6 Astra,插针成功率从26.7%涨到66.7%,汉诺塔直接从0%到100%。这说明,测试时补空间感知,能把强多模态模型本来就有的精细操作能力挖出来。项目页在https://emilia113.github.io/SpatialHarness/,有兴趣的可以自己抠细节。
这事儿对机器人行业意味着啥?
这给行业提了个醒:之前大家追着更大的模型、更多的传感器,是不是走偏了?SpatialHarness证明,很多时候不是模型没能力,是中间的感知环节没把关键信息传到位。不用硬堆算力,不用换硬件,只要在测试时补个空间感知的“外挂”,就能把现有模型的性能拉一大截。对做机器人应用的公司来说,这可能是个低成本快速落地精细操作的路子——不用等下一代大模型,也不用重构硬件,就加这么个工具就行。
现在问个没标准答案的问题:SpatialHarness只适配GPT-6 Astra,那换个开源的多模态模型,效果会不会缩水?要是能适配更多模型,会不会成为机器人精细操作的标配工具?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、具身智能
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧