郭震 AI公众号:郭震AI

实时 AI 消息

Light Origins 开源 Light-O1-Preview:6B 全身动作模型把人类视频先验搬进机器人

Light Origins 以 Apache 2.0 许可开源了约 60 亿参数的全身动作模型 Light-O1-Preview,权重发布在 Hugging Face 与 GitHub 上。该模型从人类视频中还原动作并离散化为 token 做预训练,可把同一份动作先验迁移到 LightBot、Unitree G1 等不同机器人本体上。

发布时间

Light Origins 开源了 Light-O1-Preview:一个约 60 亿参数、采用 Apache 2.0 许可的全身动作模型,权重已发布在 Hugging Face 与 GitHub 上。据 Pandaily 报道,该模型来自公司 9 月 21 日的技术博客,被定位为具身基础模型系列 Light-O1 的公开预览版本,与团队此前的 LightNav-0 导航方案并不相同。

它的核心思路是把人类视频变成机器人动作。Light Origins 的流程是先在视频中分割出人物、重建三维运动,再把根轨迹、身体姿态与手部状态离散化为动作 token;这些 token 与语言、视觉信息交错输入自回归 Transformer 做预训练,让模型从人类影像中学到动作先验,而不只依赖机器人遥操作数据。

公司公布的规模实验把多模态 token 从约 37.5 亿扩展到 1200 亿,其中最大的数据预算相当于约 10 万小时被还原的人类动作。据其描述,在适配第一视角人类数据、Unitree G1 遥操作数据集以及自有的 LightBot 数据之后,下一动作损失与全身体姿态误差都呈现幂律下降。

发布材料展示了同一个动作先验被迁移到 LightBot 和一台 Unitree G1 上,完成下跪、平衡、擦拭、拾取等行为。跨本体迁移是该模型的核心主张:一份预训练先验,适配多种机器人身体。

从接口细节看,Hugging Face 预览页列出的 6B 检查点位于 Qwen3.5-4B-Base 模型树中。模型接收一条文本指令,输出一段简短的推理链路,然后以每秒 20 帧给出全身动作序列,每帧 138 维,覆盖根节点运动、骨盆高度、偏航角、22 个关节与手部开合状态。

但它并不是开箱即用的机器人操作系统。要在真实硬件上执行这些轨迹,仍需额外的行为模型或底层控制器,Light Origins 给出的 Unitree G1 示例路径目前要在仿真中借助一个额外的策略检查点完成。公司自测的 RoboCasa GR-1 厨房仿真在 24 项任务上宏平均成功率为 79.3%,这是厂商自有结果,并非第三方公开榜单。

对机器人团队来说,实际价值在于它是一层可下载的动作先验,而且采用了 Apache 2.0 这样的宽松许可。开放的权重让实验室能够直接检验用人类视频做预训练这一说法,并在自己的本体上微调;接下来的看点在于,适配数据与底层控制器是否会部分保持闭源,以及独立评测能否在真实硬件上复现所报告的成功率。

为什么重要

宽松许可的权重让具身智能团队可以低成本地检验人类视频预训练这条路线,而不必先购买整套机器人系统。但适配数据与底层控制器的开放程度,将决定它在真实场景中的可用性。

微博邮件

Open SourceEmbodied AIRobotics
返回实时消息

附近消息

全部