实时 AI 消息
一个导航模型零样本通吃四种机器人本体:亮源新创把 2000+ 真实场景搬进仿真
亮源新创公开通用导航模型 LightNav-0,通过 Real2Sim2Real 数据引擎把 2,000 多个互联网真实场景转成可复用仿真环境,积累 4,000 多小时视觉、语言与动作后训练经验,并同步发布模型、代码和技术报告。同一个模型在 10 个仿真设置中覆盖指令跟随、目标导航与具身视觉跟踪,并零样本迁移到人形、四足、轮式和飞行机器人等不同本体。
亮源新创最新公开的通用导航模型 LightNav-0,把“机器人该往哪儿走”从一个依靠提前建图与定位的工程问题,推向了可以用数据规模化训练的基础模型问题。与它一同进入公众视野的,还有这家公司过去一个多月连续发布的三项技术:面向全身运动与跑酷的 LightParkour、面向通用导航的 LightNav-0,以及面向异常与损伤的全身控制 Light REACT。
导航的难点首先在数据。语言模型有互联网级的文本语料,机器人却没有一个天然存在的“机器人互联网”;如果导航经验全部依靠真机遥操作采集,那么每增加一个环境、每换一个机器人本体,都意味着新一轮昂贵的数据成本。
LightNav-0 的解法是 Real2Sim2Real 数据引擎:把 2,000 多个互联网来源的真实场景转换为可复用的仿真环境,形成 4,000 多小时的视觉、语言和动作后训练经验。同一个场景可以衍生出不同目标、不同路线、不同视角和不同任务,摄像机几何也随训练变化,从而避免模型只适应某一种固定机器人视角。
其中一个实验结论值得一提:在当前实验范围内,扩大“环境覆盖度”比单纯在相同环境里堆更多轨迹,更能稳定提升泛化能力。这意味着具身智能的数据 Scaling 可能与语言模型不同——不只是要更多数据,而是要在更多样化的世界里积累经验。
让视觉和语言真正变成行动,是第二个难题。接到“走到沙发右边”这类指令,理解“沙发”并不困难,困难的是判断沙发在哪里、右边在哪里、哪里可以通行,以及接下来该生成怎样的运动轨迹。LightNav-0 因此引入 Point CoT:模型先在图像空间预测目标点和可通行点,再生成后续动作 token,把推理流程从“视觉加语言直接出动作”改成“视觉语言理解、空间推理、动作生成”。
官方给出的消融结果显示,在公开的 8 项评测中引入 Point CoT 后,平均任务成功率提高 8.4 个百分点,SPL 提高 5.7 个百分点。随后,LightNav-0 通过 RVQ 动作编码器把连续机器人轨迹压缩为 3 个动作 token,使视觉、语言、空间位置和机器人动作能够进入统一的模型训练框架。
验证并没有停留在单一机器人或单一 Benchmark 上。在 10 个仿真设置中,LightNav-0 覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型进一步零样本迁移到人形、四足、轮式和飞行机器人等不同本体。官方同时发布了模型、代码和技术报告。
把三项技术放在一起看,亮源新创想回答的是同一个问题:如何让“会做一件事”变成“能力可以规模化扩展”。LightParkour 只给机器人一个起点,用强化学习和课程学习把一段人类动作扩展成适应不同障碍的技能分布,再通过多专家蒸馏收进一个统一策略;LightNav-0 解决经验和泛化如何 Scaling;Light REACT 则处理部署阶段的韧性——在受到外力扰动或硬件损伤后,模型依靠自身近期交互历史推断身体状态并调整行为,公开实验中直立行为比例从约 42% 提高到约 76%。
文章也提到了方向相近的其他工作:Skild AI 的 S1、Generalist AI 的 GEN-1.5 和 RoboTTT 都在探索减少显式人工适配,但它们的上下文主要来自外部提供的任务示范,而 Light REACT 关注的是机器人自身的身体状态。接下来值得观察的是,这套“规模化预训练、规模化对齐、规模化部署”的闭环能否真的跑起来:真实部署产生的数据能否回流到训练体系,跨本体的零样本泛化能否在更复杂的开放环境中继续成立。
为什么重要
对具身智能赛道而言,LightNav-0 把通用导航的竞争从单点 Demo 推向数据与环境覆盖度的竞争;如果零样本跨本体迁移可复现,换一种机器人就重新适配一次的成本将被显著压低。
附近消息
全部09/13 15:50
NASA与IBM发布开源月球基础模型,把30层月面数据汇入一张AI地图
NASA与IBM联合发布开源月球基础模型(Lunar Foundation Model),把来自4次月球任务、9台仪器的30多层观测数据整合进同一套多模态系统,用于识别撞击坑、绘制火山地貌并评估水冰潜藏区域。在冰潜势、不规则月海斑块制图与100米分辨率撞击坑检测等任务上,该模型相对SwinV2基线分别取得22%的误差降低、3%的IoU提升和19%的精度与mAP提升,且训练数据用量减半。
09/13 14:40
外滩大会最特别Agent白艾莉:能干活、能陪聊,还会拉黑你
今年外滩大会的一场路演上,上海米羊科技创始人徐奕成把自家桌面Agent「白艾莉(Alice)」定义为「关系型生产力Agent」——它既有人格、会发朋友圈,也能写作、生图和拆解任务。据量子位报道,官方给出的次日留存为73%、7日留存45%、90日留存15%,团队还把解决AI图像迭代伪影问题的MiRipple修复算法开源。
09/13 17:30
上海初创公司让AI销售教练对阵人类销冠,10位资深销售有7位选了AI
《财富》杂志报道,上海AI Agent公司Black Lake Technologies让AI销售教练与公司最资深的销售负责人同场对比,10位最资深销售人员中有7位投票支持机器的建议。这家向亚洲各地工厂提供AI Agent的初创公司,用一枚记录对话与位置的胸针把销售沟通喂给一个被训练成教练的AI Agent,创始人 Zhou 则说自己仍在等待AI的「Google时刻」。
09/13 18:53
Kimi K3为月之暗面带来约10亿美元收入,Anthropic称Claude被秘密使用
据Incrypted报道,月之暗面的Kimi K3为中国公司带来约10亿美元收入,显示中国大模型产品在商业侧已形成可观规模。同一报道中,Anthropic声称Claude曾被秘密使用,把焦点引向训练过程与数据来源是否合规的争议。