AI 情报卡 · 重要性 ★★★★☆ · 来源:arXiv (LLM/多模态新论文) · 2026-10-08
针对机器人学习中回归策略(MSE-Policies)与生成策略(Flow-Policies)的性能差距,研究发现残差的状态依赖变化和重尾特性是主因,提出异方差学生t动作回归策略(HT-Policies),可复用预训练网络,在仿真和真实机器人评估中表现接近生成策略,且训练推理更快,为机器人演示学习提供高效回归替代方案。
标签:AI情报、具身智能、科研前沿
由 WeValue AI 产业情报引擎自动同步

发表第一条评论吧