星光澄海 | BLOG

残差建模:缩小机器人回归与生成策略的差距

做机器人学习的人都知道,从演示数据训策略,扩散、流匹配这类生成策略,比用MSE的直接回归策略效果好。之前大家都把这差距归因为演示数据的多模态——同一个状态下,合理动作可能有好几个选择。但这篇arXiv的cs.RO论文说,锅可能根本不在多模态,而在“残差”。

【之前的归因,错在哪?】
大家默认,生成策略比MSE回归好,是因为能处理多模态演示——毕竟一个状态对应多个动作,MSE求的是平均动作,容易走偏,而生成策略能覆盖多种可能。但这篇论文偏要拆穿:他们重新分析了真实机器人的演示数据,发现差距的根源,是残差建模的问题,不是多模态。

【残差里的两个关键发现】
他们挖了两个被忽略的细节:第一,残差的尺度不是固定的——不同状态下,动作预测的误差波动差很多;第二,残差是重尾分布,比高斯分布有更多极端误差值。
再看两种策略的训练逻辑:MSE会给大残差的样本分配更多梯度权重,相当于盯着那些“离谱的误差”猛调。但问题是,这些大残差样本本身就是重尾的,噪音大,这么调反而拖了优化的后腿。而生成策略的梯度分配刚好避开了这个坑,所以表现更好。

【HT策略:快还能复用旧骨架】
针对这两个问题,他们搞出了HT策略——全称是异方差学生t回归动作策略。这套策略能学随输入变化的残差尺度,还能压低重尾的极端误差影响。
最实用的是,它是单次前馈传动作块,不用像有些生成策略那样要多步迭代,训练和推理都更快。而且,它能直接复用预训练的流匹配策略的 backbone——已经训了大模型的团队,不用推翻重来,改个头就能用,省了巨多成本。

【效果和适用场景】
实验测了四个仿真基准,还有真实机器人的任务,结果很实在:不管是从头训HT策略,还是用预训练的视觉语言动作模型、世界动作模型初始化,它的成功率都和生成策略基线相当,但训练和推理速度快很多。项目页放了所有实验细节和代码,有兴趣的可以去扒。
这相当于,既解释了生成策略为什么在机器人演示里好用,又给各种架构、各种任务,提供了一个高效的回归替代方案。

现在具身大模型微调都卡在动作策略的效率和稳定性上,要是把这个残差建模的思路套进去,会不会比现在的主流生成策略更省算力、更容易落地?


素材来源:arXiv (LLM/多模态新论文) · AI情报、具身智能、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown