郭震 AI公众号:郭震AI

实时 AI 消息

腾讯开源三大具身基座模型,首席科学家张正友详解"三层脑"如何破解机器人反应慢

WAIC 2026期间,腾讯正式开源Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0、Hy-Embodied-VLA-0.5三款具身基座模型,并配套发布持续在线具身智能体Apexio与原生框架TairosAgent。腾讯首席科学家张正友介绍,这套"三层脑"架构让认知、感知行动与底层执行按不同频率运行,将任务响应压到2-3秒,并已在日化品工厂实现超95%的作业成功率。

发布时间

WAIC 2026期间,腾讯正式开源三款具身基座模型——Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0和Hy-Embodied-VLA-0.5,并同步推出持续在线的具身智能体Apexio与原生智能体框架TairosAgent。腾讯首席科学家、Robotics X实验室主任张正友携团队在上海接受包括InfoQ在内的媒体采访,回顾了具身智能开放平台Tairos发布一年来的实质进展。

这套组合要解决的是一个常被大模型叙事掩盖的事实:机器人面对的世界,并不是按照同一种速度运行的。张正友解释,当前VLA(视觉-语言-动作)路线常见的痛点是视觉理解与动作生成在同一运行频率下执行,认知、感知和执行被迫共用同一条计算链路。而真实物理世界中,触觉反馈只有约1毫秒,底层运动控制以500Hz至1000Hz运行:让大模型按底层控制的高频率运行,算力难以承受;让底层动作等待大模型,延迟又会变成安全风险。

腾讯的做法是"分层运行、闭环训练":最上层认知系统按需唤醒,负责复杂任务理解与深度推理;中间层感知行动系统以约15Hz持续接收多模态信息并快速调整动作;最下层执行系统以更高频率运行,像条件反射一样处理碰撞、失衡等突发情况。张正友判断这套架构可能在相当长时间内保持稳定,他向InfoQ表示:"分层我认为是比较合理的一个架构,这个架构在很长的时间里面不太会变。"

这一思路源于一次失败实验。OpenClaw龙虾框架火起来后,腾讯Robotics X实验室曾把机器人能力封装成Skill交给这类通用智能体框架调度,结果"整个效果非常之差",甚至明显不如去年给宇树做的导览系统——在张正友看来,"OpenClaw操控的身体相当于浏览器,不是机器人",浏览器可以等,机器人却不能。随后团队为机器人的任务调度和模型协同专门设计了原生的TairosAgent,把响应时间压到2-3秒。

三个模型各有分工:Hy-Embodied-VLM-1.0负责空间与场景理解;Hy-Embodied-RxBrain-1.0统一认知、规划与对未来状态的想象,不仅用语言生成任务步骤与约束,还会预测每个子任务完成后物理世界应该呈现的状态;Hy-Embodied-VLA-0.5则把高层目标转化为连续、可纠错的动作,基于超1万小时人类示教数据训练,在RoboDojo评测中综合第一。

落地数据已经出现。腾讯披露,Hy-Embodied-VLA已进入一家日化品工厂开展生产测试,在高混合、小批量、SKU频繁迭代的产线上,作业成功率超过95%、单件节拍快于6秒,新增SKU留给数据采集与模型后训练的时间不到3天。张正友强调,Demo做到80分、90分,真正没有落地,几乎就等于零——实验室抓取一次物体,与生产线上连续完成数万次任务,是完全不同的考验。

在场景选择上,腾讯用"最难的"养老场景倒逼技术:展示的"小六"机器人通过双臂完成按摩动作,团队用自研的视觉、力觉与触觉采集系统记录专业手法,再以强化学习复现,目前只学习了四种双臂协同手法,下一步是进入养老院等真实环境继续迭代。张正友表示腾讯并不准备销售养老机器人本体,因为与人发生物理接触几乎集中了具身智能最困难的问题,而"进入家庭这样的非结构性环境,安全性是100%一定要保障的"。

算力需求也在快速上升:腾讯云异构计算研发总监陈煜东透露,过去部分客户用数百张卡完成模型训练,如今具身智能客户开始提出千卡、万卡规模需求,相关需求增长约200%至300%,部分模型两三天就迭代一个版本。接下来值得关注的是,腾讯能否把"分层运行、闭环训练"的架构复制到更多本体与场景,以及跨本体适配能力能否得到验证。

为什么重要

腾讯将具身智能拆分为按不同频率运行的三层架构并开源三款基座模型,其"平台+模型"的具身路径进一步清晰,分层架构能否挑战端到端VLA的主流叙事值得观察。

微博邮件

腾讯具身智能开源
返回实时消息

附近消息

全部