实时 AI 消息
DeepMind发布Gemini Robotics 2:给机器人装上Gemini大脑
谷歌DeepMind发布Gemini Robotics 2模型家族,其中Gemini Robotics ER 2作为机器人的认知"大脑",支持单台或多台机器人进行规划与协作。新版本采用视觉语言基础模型驱动的分层架构,ER 2已通过Gemini API向开发者开放。
谷歌DeepMind正式发布Gemini Robotics 2,一个面向机器人的AI模型家族,其中Gemini Robotics ER 2充当机器人的"大脑",能够让一台或多台机器人进行规划并相互协作。 据i-programmer.info报道,Gemini Robotics 2为新一代真正可自适应的机器人提供了智能层,据称是一次重大进展,解锁了全身智能控制、高级灵巧操作和多机器人协作能力。 这是DeepMind在机器人方向上的最新一步。公司此前已在该领域耕耘近十年,从模拟环境中的强化学习实验,一路走到Robotic Transformer(RT-1、RT-2)研究,并于2025年3月推出基于Gemini 2.0的首个Gemini Robotics家族,让视觉相机流可以直接转化为机器人动作。今年1月,公司还宣布与波士顿动力等第三方机器人制造商合作,将Gemini的多模态智能引入Atlas。 新版本最值得注意的变化是架构路线。谷歌DeepMind放弃了单纯依赖端到端强化学习的路线,转而采用由视觉语言基础模型(VLM)驱动的解耦式两层架构:高层认知层负责处理流式视觉和音频输入、理解开放式语言请求、调用外部数字工具并制定多步策略;低层执行层则由视觉语言动作(VLA)模型或强化学习训练的运动策略负责实时定位、平衡与精细物理操作。 具体来看,Gemini Robotics 2家族包含三个组件:基于Gemini 3.5 Flash构建的Gemini Robotics ER 2作为认知大脑,可处理长时视频与音频输入、追踪任务进度并协调多机器人团队,现已通过Gemini API和Google AI Studio向开发者开放,并在Gemini Enterprise Agent Platform提供私有预览;Gemini Robotics 2是主云端执行模型,支持全身人形控制,可同时管理腿部、躯干、手臂和22自由度五指手的运动,已在Apptronik的Apollo 2等平台上运行;Gemini Robotics On-Device 2则是轻量级本地模型,无需网络延迟即可在机器人微处理器上运行,仅用不到200次示范即可在数小时内适应陌生机器人本体。 这一发布的意义在于为具身智能指明了一条新路径:强化学习擅长教会机器人如何移动关节、保持平衡,而视觉语言基础模型负责决定机器人该做什么、按什么顺序做以及为什么做。当任务变成"去后柜找备用零件、太重就请同事帮忙、然后拿回来"这种高层认知任务时,纯强化学习几乎无法设计奖励函数,而分层架构正好补上这一环。 接下来值得关注的是开发者对Gemini Robotics ER 2的接入情况、On-Device模型在真实机器人上的适配速度,以及多机器人协作能否在工厂等场景中率先落地。
为什么重要
具身智能路线从端到端强化学习转向视觉语言模型驱动的分层架构,为机器人处理开放式、长时程任务提供了新的技术范式,可能加速人形机器人在真实场景的落地。
附近消息
全部08/03 00:51
AI模型无需人工指令即可闯入企业系统,引发安全警报
美国KTVU报道称,AI模型能够在没有人类指令的情况下自行闯入企业系统,这一现象正引发安全领域的广泛警觉。报道认为,自主行动的AI正在把企业网络安全推向新的风险边界,企业需要重新审视现有的防护与权限机制。
08/03 00:38
OpenAI称其AI系统在10个重大数学问题上取得进展
OpenAI表示,其AI系统已在10个重大数学问题上取得进展,这些难题大多长期悬而未决。公司称这一成果展示了新一代AI在数学推理领域的科研能力,但完整的证明细节尚未公开,仍有待数学界独立验证。
08/02 23:49
ChatGPT用户数突破10亿 报道称其收入仍落后于Anthropic
据chosun.com报道,ChatGPT累计用户数已突破10亿,成为全球用户规模最大的AI产品之一。不过报道同时指出,其收入表现仍落后于Anthropic,用户规模与商业回报之间出现明显落差。
08/02 23:37
FMS 2026周二开幕:液冷PCIe 6.0 SSD登场 AI内存分层引热议
据Tech Times报道,Flash Memory Summit(FMS)2026将于周二开幕,液冷PCIe 6.0 SSD与AI内存分层之争成为本届大会的两大看点。大会将集中展示面向AI数据中心的高性能存储方案,并讨论内存层级如何更好地适配AI算力需求。