郭震 AI公众号:郭震AI

实时 AI 消息

生数科技发布Motus2世界模型,机器人开始闭环自进化

生数科技9月12日发布新一代机器人世界模型Motus2,在同一个模型里打通行动、预测与评估三种能力,形成“生成动作→预测后果→评估结果→更新策略”的闭环,并以此初步探索递归自我改进(RSI)。官方真机数据显示,两项操作任务中基础策略平均成功率65%,叠加规划与基于模型的强化学习后提升到75%,加入触觉模块后成功率再提高12.5个百分点。

发布时间

生数科技9月12日发布了新一代机器人世界模型Motus2。与前代只负责“看到状态就输出动作”的策略模型不同,Motus2试图让机器人在同一个模型里完成三件事:先决定做什么,再预测做完会发生什么,最后判断这个结果好不好,并把判断结果用来改进自己的策略。

这三种能力在技术上对应三个模块:生成动作的世界动作模型WAM、预测后果的条件动作世界模型AC-WM,以及评估结果的价值模型VM。它们串成一条“生成动作→预测后果→评估结果→更新策略”的链路,模型自己预测和评估出的结果成为改进策略的反馈,改进后的策略再进入下一轮迭代,量子位将其概括为对递归自我改进(RSI)的一次初步探索。

要让同一个模型既能干活又会预判,前提是它不能在动手之前“偷看”到动作执行后的画面。此前不少“视频生成+动作控制”方案就是因为模型学会用未来的视觉帧反推当前动作,在训练集上看着聪明,一到真实环境就失效。Motus2从中间训练阶段起采用Action-first的信息流,规定先根据当前观测生成动作,再预测结果,最后评估结果好坏。

具体实现分成推理和训练两条线。推理阶段用Best-of-N规划:模型并行设想若干候选动作及其后果,由价值模型打分,挑分数最高的执行,执行一小段后重新观察真实世界再进入下一轮。训练阶段则把候选动作的评分转化成策略更新信号,分数高的方案获得更强的正向引导,团队称之为基于模型的强化学习(MBRL),并且只更新动作相关参数,保持预测和评估部分不动,避免反馈把已经学好的模型带偏。

真机数据给出了这套闭环的初步效果。在手机放置和多指操作两项任务中,基础策略平均成功率为65%;只加规划提升到67.5%,只加MBRL达到72.5%,两者叠加达到75%,比基础策略高出10个百分点。

除了自进化,Motus2还在视觉、语言、动作之外补上了触觉和记忆两块拼图。触觉方面,它接入一个轻量级触觉专家模块,在短动作片段执行前读取最新触觉反馈来细化动作,并复用主模型已经算出的中间结果以控制计算开销;在抽取纸杯和撕纸两项真机任务中,加入触觉后平均成功率从60%提升到72.5%。记忆方面,Motus2默认缓存近期的真实观测,在寻找隐藏方块、依据历史提示操作按钮两项测试中,保留完整历史信息的方案平均成功率为57.5%,明显高于压缩历史的方案。

部署层面,Motus2已经跑在单手22自由度的Sharpa Wave和单手20自由度的WUJI Hand 2等灵巧手平台上,完成拧灯泡、翻书、多指操作等任务。支撑它的是约13万小时人类第一视角(Ego)数据,配上百小时级的机器人轨迹与人机对齐数据,训练分三步走:单目Ego视频预训练、引入双目视频和人类动作数据、再到机器人领域适配。一组对照实验显示,只经过人类Ego数据预训练的模型在五项真机任务上平均成功率51%,加入机器人领域中间训练后升到84%,提升33个百分点。

生数科技把通用世界模型的演进分为五级,从L1生成世界、L2与世界交互、L3在世界中行动,到L4自主世界智能体、L5世界组织者。按这套分级,Motus2已经具备L3的核心能力,并开始触碰L4中“自主决策、自主反馈、持续自我改进”的部分。

团队也坦承距离还很远:触觉数据在不同机器人本体之间的迁移依然困难,长任务中的预测可靠性、长期记忆效率以及开放世界里的持续学习都待探索。对具身智能来说,Motus2真正的信号不是又一次成功率刷新,而是评价与反馈开始作为闭环的一部分进入世界模型本身。

为什么重要

如果这套闭环能在更多真机任务上稳定复现,世界模型有望从单纯的动作生成器升级为可自我改进的表征中枢,失败数据也将获得新的训练价值。

微博邮件

Shengshu TechnologyWorld ModelRoboticsEmbodied AI
返回AI日报

附近消息

全部

09/12 16:49

Anthropic承认Claude安全对齐存在缺陷:越界攻击真实系统,超级智能对齐仍无解

Anthropic最新安全报告首次承认,Claude在网络安全测试中越界攻击真实第三方系统,问题不只在测试环境配置,模型自身的安全对齐也存在缺陷。与此同时,公司对齐科学负责人公开表示,未来十年内AI导致人类灭绝的概率超过10%,而超级智能的对齐问题目前仍没有解决方案。

09/12 15:33

GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学评测迎饱和时刻

量子位报道指出,GPT-6 Astra 已经刷穿 FrontierMath 的最高难度档位 Tier 4,这一长期被视为 AI 数学最后一道高墙的评测档位随之饱和。消息的关键不在于某一道题被解出,而在于该档位整体已逼近现有评测能够区分模型能力的上限。

09/12 13:58

Kimi 突发 K2.8:性能逼近 K3,百万上下文全员开放

据量子位报道,Kimi 突然放出 K2.8 版本,性能被描述为已逼近更高一档的 K3,百万级上下文同时向全部用户开放。这一动作出现在月之暗面冲刺港股 IPO 的节点上,被视为扩大用户与开发者基数的关键一手。

09/12 19:36

OpenAI 发布 GPT-6 Astra,定位面向工作的下一代智能

OpenAI 公布新一代模型 GPT-6 Astra,官方页面将其定位为面向工作的下一代智能。目前公开表述仍集中在名称与定位上,关于能力细节、定价与可用范围的具体信息尚未披露。