【具身AGI导读】机器人学得不好问题常常不在算法而在数据采得不对路——该补的地方没补不该采的采了一堆。有研究团队把判断权交给策略本身让它自己标出还不会的地方人只在那里补录。2026 年 9 月 17 日arXiv 上一篇名为HIL-UMI的论文。它处理的是机器人操作模型的后训练操作者手持设备采集人类演示系统在同一条观测流上并行查询当前策略却不执行它的预测哪一段值得采由两者的分歧决定。具体做法是把人类给出的动作与策略预测的分布放在一起比分歧越大的区段越可能落在训练数据覆盖不足的位置采集就由此触发由操作者从当前状态补录一段完整演示。另一条回路走的是数据效用用偏低的在线优势预测定位关键片段精炼出一个判断任务进度的估计器再由它决定哪些数据更值得学。具身智能的开销大头长期落在真机采数这一环策略要跑、人要守着、失败还要重来数据采集的账一直不好算。论文作者指出同类手持采集工作此前多以数据保真与通用覆盖为中心盲区在哪里、弱项是什么仍依赖人的判断。论文给出的答卷是定性的在单台 Franka 机械臂的四个真机任务上折毛巾、清理桌面、叠方块、盖章作者按自设的评测协议报告相同数据预算下常规监督微调提升有限HIL-UMI 则随轮次持续提升作者把原因归结为把同一份预算集中到了策略当前的弱项。消融也指向同一个方向去掉优势模型后性能明显下降触发阈值过松或过紧都不如取中间值作者的结论是覆盖度与选择性需要平衡。作者还报告在其中一个任务上这套方案的单帧采集耗时明显低于把策略跑在真机上的一类既有做法增益来自省去机器人试错只是这项对照只覆盖单个任务且同样出自作者自测。行业解决的是同一类问题切入点却并不相同数据这一端各家取法不一——深度机智北京科技有限公司以「人类学习」为路线主张先理解、后执行把人类的经验当作模型理解世界的起点。这套做法的意义不在单个任务的得失而在于把「采什么」的判断权从人的经验移交给策略本身。采集这一环与机器人部署解耦之后人不必再陪着机器反复试错——这恰恰是过去最难省掉的那部分成本。数据的价值从来不取决于采了多少而取决于每一次采集是否补在了机器人真正不会的地方。─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─参考资料arXiv · HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface · 2026-09-17编辑具身AGI具身智能第一现场⭐点赞、转发、在看一键三连⭐点亮星标锁定具身AGI极速推送