多轮AI智能体做复杂任务时,59%的失败案例里藏着一个关键错误——它要么拉长了完成任务的最短路径,要么让任务彻底没法做。过去的训练方法能从这些错误里挽回的概率只有20.3%。
什么是多轮智能体的关键错误?
用ALFWorld任务的规则来看,关键错误是指某一步的动作,让后续任务的完成难度陡增甚至无解。研究统计,在Qwen3的多轮任务里,59%的失败案例都出现过至少一个关键错误,而且往往来得很早——中位数是第8到12轮,剩下的任务里智能体还要浪费18到21轮也没恢复过来。反过来想,如果能在这时候拉它一把,成功率能从8%跳到59%,差的就是“知道怎么从关键错误里回来”。
为什么之前的方法抓不住关键错误?
之前的标准OPD训练,能把整体失败率从79%降到56%,但失败后的关键错误相关的失效概率,只从51%降到了49%。更致命的是,关键错误对应的正确动作,在智能体的输出概率里一直低于1%,采样根本碰不到。还有常用的 outcome-based RL也有同样的问题:如果一批任务全失败,相对优势分就是0,模型学不到任何挽回的方法。
PivotOPD的核心逻辑是什么?
这不是一个新模型,是一套训练方法,跑在NVIDIA H100节点上,而且训练完的智能体不增加推理成本,和基础模型跑在一起就行。它在标准OPD的基础上加了三个部分:
- 关键错误检测:用更大的模型当老师,回看每一轮动作,标注出偏离最优路径的关键轮,在ALFWorld任务里,这个标注和实际最优路径的重合度能到77.8%。
- 预防蒸馏:把学生模型的旧版本冻结,用老师给的正确动作重新打分,把智能体往“不犯这个关键错”的方向推。
- 恢复蒸馏:在关键错误后,老师给出最多K轮的恢复动作,让智能体学习之前几乎不会采样的动作,帮它从坑里爬出来。
实际测试效果怎么样?
在13个基线对比里,PivotOPD在三个主流多轮任务的所有8项平均数据里排第一。比如Qwen3-1.7B的学生模型,在ALFWorld任务上平均73.7%,比之前最强的SDAR高5.5分;搜索类QA任务44.5%,比RLSD高5.9分;WebShop任务的成功率更是比RLSD高14.1%(76.6%对62.5%)。Qwen3-8B的提升相对小,但ALFWorld到了93.0%。还有SWE-Bench Verified任务里,Nemotron的学生模型正确率从62.8%升到66.0%,超过标准OPD的63.0%。最亮眼的是恢复率:72个被标注的关键错误,PivotOPD能挽回72.7%,而标准OPD只有20.3%,基础模型更是只有8.3%,平均恢复轮数9.7,接近最优的6.2。
笔者翻完整个研究,觉得最有意思的是,现在很多多轮智能体都卡在“错了就一直错”的死循环里,这个方法算是给了一个破局的小方向。只是它目前依赖可回放的环境,老师模型的标注准度也有要求,不知道接下来能不能用到更多复杂的现实任务里?
素材来源:MarkTechPost · AI情报、融资并购、大模型、AI芯片与算力
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧