郭震 AI公众号:郭震AI

实时 AI 消息

灵初智能更新 Psi-R2.5:逆向使用世界模型 Psi-W0,解决人机动作对不齐

灵初智能在十万小时级数据积累的基础上,更新了具身模型 Psi-R2.5 的数据质量与人机数据对齐方法,通过逆向使用世界模型 Psi-W0,从真实机器人数据出发生成对应的人类操作数据,得到可用的强配对数据。据灵初介绍,这类转换后的数据既可用于训练,也可作为机器人当前任务的示范提示,其手机盒装配任务成功率约 99%。

发布时间

具身智能领域一直有个绕不开的问题:人类每天都在干活,这些操作经验究竟怎样才能交给机器人。灵初智能最新披露的工作把这个问题往前推了一步——人类数据进了模型,并不等于人的操作经验就能被机器人直接使用。在十万小时级数据积累的基础上,其模型 Psi-R2.5 继续改进数据质量与人机数据对齐方法,并进一步推进具体任务适配。

难点在于,人机动作并不天然对应。人手和机械手不仅长得不一样,关节结构、接触物体时的摩擦条件也不同,再加上人手姿态估计存在误差,一个人可以顺利完成的动作,转换成机器人的关节运动后未必还能成功。灵初把人和机器人执行类似任务、主要在任务含义上对应的数据称为弱配对数据;它更希望获得的是强配对数据:除了本体不同,两边场景基本一致,动作时序逐帧对应,而且机器人一侧的动作能够在真机上直接回放成功。

但这样的数据很难直接采集。让人和机器人各做一遍,很难保证场景与动作时序逐帧对应;直接照搬人的轨迹也未必成功。今年 4 月,灵初已经尝试让 Psi-R2 与世界模型 Psi-W0 配合,通过轨迹推演和强化学习把人类操作转换成可执行的机器人数据,问题是这套流程涉及多个模型协同和策略优化,生产数据的过程比较重。

这次灵初换了个方向:逆向使用 Psi-W0。真实机器人操作的图像和动作本来就是可用的,以它们为起点生成匹配的人类操作数据,就能得到一份新的对照样本。这些高质量配对数据被用于训练一个端到端转换器,输入是人类操作数据,输出则是匹配的机器人图像和动作。需要区分的是,这个转换器不是决定机器人下一步做什么的策略模型,而是一个带动作输出的视频编辑模型。

转换有没有用,怎么判断?灵初设置了两种验证方式:一种是在机器人上直接回放转换后的轨迹,看能否完成相同任务;另一种是把转换后的数据用于后训练,再看训练出的模型能否完成相关任务。判断标准不再只是生成的视频像不像,而是数据能不能支持实际操作。据灵初介绍,转换后的数据已在这两类测试中得到验证,不过部分特别复杂的任务仍未直接完成,数据转换并不等于所有任务都已经解决。

数据本身的质量也做了重新梳理。Psi-R2.5 减少同一任务的重复堆积、增加任务多样性,并通过自动标注管线把任务拆解到更细的原子动作,再进行标注和审核——数据的价值不能只按小时算,还得看覆盖了多少种任务、机器人能用上多少。

另一个探索方向是上下文学习(In-Context Learning,ICL):新示范不一定要再走一遍训练流程,也可以作为当前任务的参考交给已经训练好的模型,机器人无需更新模型参数,而是根据上下文线索推断该做什么、该如何做。这与 Psi-R2.5 的双层架构相衔接:上层模型负责把长程任务拆解成子任务,下层模型结合子任务和当前观测输出具体操作轨迹。灵初也提醒,目前展示的是特定任务中的 ICL 能力,更多实现细节尚待公布。

预训练与后训练的关系同样被重新界定。灵初在最新的 Tech blog 中指出,预训练并不是让后训练立刻消失;真实部署面对的物品种类、规格和作业节拍往往带有很强的定制化要求,现阶段训练基础模型的意义应该是让后训练需要的数据更少,从而降低适配与部署的成本。以手机盒装配为例,通过结合人工参与与强化学习的后训练框架,经过几轮迭代,任务成功率达到约 99%,耗时 1-2 个工作日;机器人在客户现场失败的数据也会被收集回来,用于下一轮改进。

把人的示范转换成机器人可用的数据与提示,指向的是一条更现实的落地路径:客户不必为每个新任务从零训练,而是用一段示范加上少量后训练数据把机器人用起来。后续值得观察的,是这种强配对数据转换在更复杂任务上的成功率,以及 ICL 能力能否从特定任务扩展到更开放的操作场景。

为什么重要

把人类示范转换成机器人可直接执行的数据与提示,意味着客户可以用一段示范加少量后训练数据把机器人用起来,降低适配成本。行业需要观察的是这套强配对数据方法在更复杂任务上的成功率,以及 ICL 能否扩展到开放场景。

微博邮件

灵初智能具身智能Robotics
返回实时消息

附近消息

全部