郭震 AI公众号:郭震AI

实时 AI 消息

一个导航模型零样本通吃四种机器人本体:亮源新创把 2000+ 真实场景搬进仿真

亮源新创公开通用导航模型 LightNav-0,通过 Real2Sim2Real 数据引擎把 2,000 多个互联网真实场景转成可复用仿真环境,积累 4,000 多小时视觉、语言与动作后训练经验,并同步发布模型、代码和技术报告。同一个模型在 10 个仿真设置中覆盖指令跟随、目标导航与具身视觉跟踪,并零样本迁移到人形、四足、轮式和飞行机器人等不同本体。

发布时间

亮源新创最新公开的通用导航模型 LightNav-0,把“机器人该往哪儿走”从一个依靠提前建图与定位的工程问题,推向了可以用数据规模化训练的基础模型问题。与它一同进入公众视野的,还有这家公司过去一个多月连续发布的三项技术:面向全身运动与跑酷的 LightParkour、面向通用导航的 LightNav-0,以及面向异常与损伤的全身控制 Light REACT。

导航的难点首先在数据。语言模型有互联网级的文本语料,机器人却没有一个天然存在的“机器人互联网”;如果导航经验全部依靠真机遥操作采集,那么每增加一个环境、每换一个机器人本体,都意味着新一轮昂贵的数据成本。

LightNav-0 的解法是 Real2Sim2Real 数据引擎:把 2,000 多个互联网来源的真实场景转换为可复用的仿真环境,形成 4,000 多小时的视觉、语言和动作后训练经验。同一个场景可以衍生出不同目标、不同路线、不同视角和不同任务,摄像机几何也随训练变化,从而避免模型只适应某一种固定机器人视角。

其中一个实验结论值得一提:在当前实验范围内,扩大“环境覆盖度”比单纯在相同环境里堆更多轨迹,更能稳定提升泛化能力。这意味着具身智能的数据 Scaling 可能与语言模型不同——不只是要更多数据,而是要在更多样化的世界里积累经验。

让视觉和语言真正变成行动,是第二个难题。接到“走到沙发右边”这类指令,理解“沙发”并不困难,困难的是判断沙发在哪里、右边在哪里、哪里可以通行,以及接下来该生成怎样的运动轨迹。LightNav-0 因此引入 Point CoT:模型先在图像空间预测目标点和可通行点,再生成后续动作 token,把推理流程从“视觉加语言直接出动作”改成“视觉语言理解、空间推理、动作生成”。

官方给出的消融结果显示,在公开的 8 项评测中引入 Point CoT 后,平均任务成功率提高 8.4 个百分点,SPL 提高 5.7 个百分点。随后,LightNav-0 通过 RVQ 动作编码器把连续机器人轨迹压缩为 3 个动作 token,使视觉、语言、空间位置和机器人动作能够进入统一的模型训练框架。

验证并没有停留在单一机器人或单一 Benchmark 上。在 10 个仿真设置中,LightNav-0 覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型进一步零样本迁移到人形、四足、轮式和飞行机器人等不同本体。官方同时发布了模型、代码和技术报告。

把三项技术放在一起看,亮源新创想回答的是同一个问题:如何让“会做一件事”变成“能力可以规模化扩展”。LightParkour 只给机器人一个起点,用强化学习和课程学习把一段人类动作扩展成适应不同障碍的技能分布,再通过多专家蒸馏收进一个统一策略;LightNav-0 解决经验和泛化如何 Scaling;Light REACT 则处理部署阶段的韧性——在受到外力扰动或硬件损伤后,模型依靠自身近期交互历史推断身体状态并调整行为,公开实验中直立行为比例从约 42% 提高到约 76%。

文章也提到了方向相近的其他工作:Skild AI 的 S1、Generalist AI 的 GEN-1.5 和 RoboTTT 都在探索减少显式人工适配,但它们的上下文主要来自外部提供的任务示范,而 Light REACT 关注的是机器人自身的身体状态。接下来值得观察的是,这套“规模化预训练、规模化对齐、规模化部署”的闭环能否真的跑起来:真实部署产生的数据能否回流到训练体系,跨本体的零样本泛化能否在更复杂的开放环境中继续成立。

为什么重要

对具身智能赛道而言,LightNav-0 把通用导航的竞争从单点 Demo 推向数据与环境覆盖度的竞争;如果零样本跨本体迁移可复现,换一种机器人就重新适配一次的成本将被显著压低。

微博邮件

亮源新创LightNav-0具身智能机器人导航
返回实时消息

附近消息

全部

09/13 15:50

NASA与IBM发布开源月球基础模型,把30层月面数据汇入一张AI地图

NASA与IBM联合发布开源月球基础模型(Lunar Foundation Model),把来自4次月球任务、9台仪器的30多层观测数据整合进同一套多模态系统,用于识别撞击坑、绘制火山地貌并评估水冰潜藏区域。在冰潜势、不规则月海斑块制图与100米分辨率撞击坑检测等任务上,该模型相对SwinV2基线分别取得22%的误差降低、3%的IoU提升和19%的精度与mAP提升,且训练数据用量减半。

09/13 14:40

外滩大会最特别Agent白艾莉:能干活、能陪聊,还会拉黑你

今年外滩大会的一场路演上,上海米羊科技创始人徐奕成把自家桌面Agent「白艾莉(Alice)」定义为「关系型生产力Agent」——它既有人格、会发朋友圈,也能写作、生图和拆解任务。据量子位报道,官方给出的次日留存为73%、7日留存45%、90日留存15%,团队还把解决AI图像迭代伪影问题的MiRipple修复算法开源。

09/13 10:33

美情报机构指控阿里巴巴大规模窃取AI数据

据 simplywall.st 报道,美国一家情报机构提出指控,称阿里巴巴存在大规模窃取 AI 数据的行为,消息直接把这家云计算与 AI 大厂推到风险敞口之下。报道以投资视角切入,重点讨论该指控可能给阿里巴巴(BABA)带来什么。

09/13 10:25

报道称特朗普政府在 AI 网络风险管控上存在分歧,担心拖慢美国竞争节奏

据报道,特朗普政府内部在如何管控 AI 网络安全风险上存在分歧,核心矛盾在于既要压住风险,又不愿因此放慢美国在 AI 竞赛中的速度。这场争论把安全治理与产业竞争之间的张力摆上台面,成为观察美国 AI 政策走向的一个关键切口。