郭震 AI公众号:郭震AI

实时 AI 消息

DeepMind发布Gemini Robotics 2:给机器人装上Gemini大脑

谷歌DeepMind发布Gemini Robotics 2模型家族,其中Gemini Robotics ER 2作为机器人的认知"大脑",支持单台或多台机器人进行规划与协作。新版本采用视觉语言基础模型驱动的分层架构,ER 2已通过Gemini API向开发者开放。

发布时间
DeepMind发布Gemini Robotics 2:给机器人装上Gemini大脑
图源: deepmind.google

谷歌DeepMind正式发布Gemini Robotics 2,一个面向机器人的AI模型家族,其中Gemini Robotics ER 2充当机器人的"大脑",能够让一台或多台机器人进行规划并相互协作。 据i-programmer.info报道,Gemini Robotics 2为新一代真正可自适应的机器人提供了智能层,据称是一次重大进展,解锁了全身智能控制、高级灵巧操作和多机器人协作能力。 这是DeepMind在机器人方向上的最新一步。公司此前已在该领域耕耘近十年,从模拟环境中的强化学习实验,一路走到Robotic Transformer(RT-1、RT-2)研究,并于2025年3月推出基于Gemini 2.0的首个Gemini Robotics家族,让视觉相机流可以直接转化为机器人动作。今年1月,公司还宣布与波士顿动力等第三方机器人制造商合作,将Gemini的多模态智能引入Atlas。 新版本最值得注意的变化是架构路线。谷歌DeepMind放弃了单纯依赖端到端强化学习的路线,转而采用由视觉语言基础模型(VLM)驱动的解耦式两层架构:高层认知层负责处理流式视觉和音频输入、理解开放式语言请求、调用外部数字工具并制定多步策略;低层执行层则由视觉语言动作(VLA)模型或强化学习训练的运动策略负责实时定位、平衡与精细物理操作。 具体来看,Gemini Robotics 2家族包含三个组件:基于Gemini 3.5 Flash构建的Gemini Robotics ER 2作为认知大脑,可处理长时视频与音频输入、追踪任务进度并协调多机器人团队,现已通过Gemini API和Google AI Studio向开发者开放,并在Gemini Enterprise Agent Platform提供私有预览;Gemini Robotics 2是主云端执行模型,支持全身人形控制,可同时管理腿部、躯干、手臂和22自由度五指手的运动,已在Apptronik的Apollo 2等平台上运行;Gemini Robotics On-Device 2则是轻量级本地模型,无需网络延迟即可在机器人微处理器上运行,仅用不到200次示范即可在数小时内适应陌生机器人本体。 这一发布的意义在于为具身智能指明了一条新路径:强化学习擅长教会机器人如何移动关节、保持平衡,而视觉语言基础模型负责决定机器人该做什么、按什么顺序做以及为什么做。当任务变成"去后柜找备用零件、太重就请同事帮忙、然后拿回来"这种高层认知任务时,纯强化学习几乎无法设计奖励函数,而分层架构正好补上这一环。 接下来值得关注的是开发者对Gemini Robotics ER 2的接入情况、On-Device模型在真实机器人上的适配速度,以及多机器人协作能否在工厂等场景中率先落地。

为什么重要

具身智能路线从端到端强化学习转向视觉语言模型驱动的分层架构,为机器人处理开放式、长时程任务提供了新的技术范式,可能加速人形机器人在真实场景的落地。

微博邮件

Google DeepMindGemini RoboticsRobotics
返回实时消息

附近消息

全部