实时 AI 消息
看3秒演示就能学会新动作,Generalist AI发布机器人基础模型GEN-1.5
机器人公司Generalist AI发布新一代机器人基础模型GEN-1.5:机器人只需观看3-12秒动作示范,无需梯度更新或微调即可学会新任务。该模型还能把多段演示拼接成连续任务,并将模拟器中的虚拟示范迁移到真实世界,被业界视为机器人领域的GPT-3时刻。
机器人公司Generalist AI发布新一代机器人基础模型GEN-1.5,主打One-shot Learning:机器人只需观看一段3-12秒的动作示范,无需任何梯度更新或微调,就能立即上手执行全新任务。
除了单任务模仿,GEN-1.5还能把两段不同的教学演示拼接成一个连续任务,中间从未被演示过的衔接动作——重新定位、调整抓法、切换姿势,甚至出错后的继续执行——都由模型自行补全。
更特别的是,示范来源不必是真人:脚本策略生成的动作、强化学习智能体的演示、人类在模拟器中的遥操作,都能作为物理提示(Physical Prompt)进入模型上下文;模型看过模拟器里的虚拟演示后,可以直接在真实世界1:1复现,而该任务此前在模拟器和真实环境中都未曾专门训练过。
在10种任务的测试中,只给一次Physical Prompt、0次梯度更新的情况下,GEN-1.5平均成功率达到59%;如果每个任务补充5分钟数据并进行10步梯度更新,成功率可提升至83%。团队也承认,现阶段测试任务大多属于短程、相对原子化的操作,通过上下文临时习得的技能在稳定性上还赶不上真正微调后的模型。
最让研究圈兴奋的是,Generalist表示并未为One-shot Learning设计专门的模型架构、元学习循环或额外目标函数,这一能力是在长达8个多月的大规模物理数据预训练过程中自发涌现的——预训练期间团队发现,新任务所需数据从几百步微调一路降到几十步、10步,最后甚至只需1分钟数据和1个梯度步。
这正是它被比作机器人界GPT-3时刻的原因:GPT-3当年用In-Context Learning让模型不用重新训练就能学会新任务,GEN-1.5把同样的逻辑搬进了物理世界,示范动作取代文字提示,成为机器人理解任务的上下文。
接下来值得关注的是,这种零训练习得的能力能否在更长程、更复杂的任务上保持稳定,以及看一遍就会是否会成为机器人基础模型的标配范式。
为什么重要
一次性学习能力若在更长任务上保持稳定,将显著降低机器人技能获取成本,推动看一遍就会成为机器人基础模型的新范式。
附近消息
全部08/21 15:03
M3发布后MiniMax走了一员大将:Agent工程部主管阿岛(缪宇航)确认离职
据蓝鲸新闻报道,MiniMax Agent工程部主管阿岛(缪宇航)的飞书状态已显示离职,下一站尚不明确,其X主页认证信息尚未更新。阿岛在X上自称MiniMax的Head of Engineering,负责M2.x、Agent、Audio和海螺AI,2023年加入MiniMax,此前曾任职于百度、贝壳和字节跳动。
08/21 16:03
中国平安发布2026年上半年业绩:AI智能体辅助销售额超573亿元,日均Token消耗达1200亿
中国平安发布2026年上半年业绩,其中AI智能体辅助实现的销售额超过573亿元,AI日均Token消耗量飙升至1200亿。这表明大模型能力已深度嵌入保险与金融业务运营,AI正从内部工具变为直接贡献收入的环节。
08/21 13:59
商汤科技开源8B多模态模型,原生支持4K图像输出
商汤科技(SenseTime)近日开源了一款80亿参数的多模态模型,原生支持4K分辨率图像输出。这一开源动作将高分辨率图像生成能力直接带入开源社区,为开发者提供了一个新的多模态基础模型选择。
08/21 13:33
深势科技把科研全流程搬进一个桌面:科学家提问题,AI跑实验
深势科技推出一款将科研全流程搬进桌面的产品,科学家只需提出问题,AI负责运行实验。官方称这一设计意在让科学家的时间回到科学创造本身,降低实验室使用AI的门槛。