郭震 AI公众号:郭震AI

实时 AI 消息

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent

清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源,把通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,与记忆、工具和机器人接口连成从感知到反馈纠错的完整闭环。该系统在LIBERO-PRO基准测试中达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上,真机可完成倒钢珠、双臂擦盘、移开遮挡物找勺子等开放式任务。

发布时间

这一时间点并非偶然。报道提到,随着GPT-6 Astra开始接受真实机器人操作测试,让大模型作为决策大脑的智能体范式正逐渐走向物理世界。但机器人面对的不是可以随时回滚的代码:环境持续变化、状态无法完全观测,动作一旦发生也很难轻易撤销,抓取、装配、插拔等精细操作更需要专门的模型与控制能力。

性能方面,RPent在LIBERO-PRO基准测试中达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。项目由大规模具身强化学习框架RLinf的核心团队打造,延续了该团队在具身智能基础设施领域的技术积累。

真机演示展示了多个开放式任务:机器人将钢珠倒入碗中,双臂协同擦拭盘子,还会主动移开遮挡物找到藏在碗下的勺子。值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略,机器人真正发生的变化,是开始从执行学过的动作,走向理解任务、调用能力,并根据环境变化调整行动。

效率的关键是Flash Mode与任务卡。探索成功后,RPent会把经过验证的任务逻辑沉淀为任务卡,记录任务阶段、动作原语、关键目标和检查条件,而不保存只能在一次场景中使用的固定坐标;再次执行时启用Flash Mode复用这套流程,只根据当前视觉状态做必要调整,只有检查失败或环境偏离时才重新调用规划器。在LIBERO Object的200次评测中,开启Flash Mode将平均执行时间从283.6秒降低至40.9秒,在成功率仅下降3.5个百分点的情况下,实现约7倍加速。

另一根支柱是记忆。RPent把经验按复用范围组织为三层记忆,并为每条记忆记录适用范围、类型、可信度和支撑证据,新经验需要经过验证才能提高可信度,相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。在LIBERO-Pro Goal实验中,引入记忆机制后,位置交换任务的成功率从31.0%提升至87.0%,记忆资产还可以分发到其他智能体。

架构上,RPent分为用户层、智能层、接口层和环境层,智能层由Agentic Planner与Action Primitive组成,把VLA、WAM等学习型操作模型和程序化技能统一封装为可调用工具。框架已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备,并通过MCP、RPC、MHS三层接口把智能决策与物理执行解耦。

从技术路线看,纯VLA端到端精细操作做得好,但任务变长、场景被扰动时容易退化;纯大模型Agent在亚厘米级精度、执行时延和越用越强这几件事上仍有短板。RPent没有在两条路线之间折中,而是将具身智能拆解为不同层次的能力,让通用大模型负责理解任务与制定计划,VLA、WAM等专家模型负责高精度动作执行,记忆系统沉淀经验,框架负责连接模型、工具与真实环境。背后的算法源于团队7月提出的Harness VLA工作。

接下来值得观察的是生态层面:RPent同时推出Leaderboard板块,用不同技术路线、不同基座模型的方案对比性能;开源之后,社区能否跨机器人复用任务卡与记忆资产,把具身智能体的能力从一次性部署推向持续演进,将决定这套基础设施的实际价值。

为什么重要

RPent的价值在于把由一个模型包办一切改成能力分层,大模型负责规划、专家模型负责执行、记忆负责沉淀经验,这正是具身智能体走出现场演示、进入真实生产环境所需要的工程底座。如果92.6%的任务成功率、7倍加速与记忆资产分发能在第三方复现中成立,开源社区就获得了一套可复用的具身智能基础设施,而不只是一段真机视频。

微博邮件

RoboticsEmbodied AIOpen Source
返回AI日报

附近消息

全部

09/21 14:06

亚马逊阻止Meta的Muse智能体在其网站购物,代理式电商之争升级

据GeekWire报道,亚马逊以安全、隐私和透明度为由,阻止Meta新推出的个人AI智能体Muse在Amazon.com上购物,此前还曾试图让Meta把该网站排除在这项体验之外。使用Muse在亚马逊购物的用户现在会看到弹窗,提示未经授权的AI智能体继续访问违反亚马逊使用条款;亚马逊称事先并不知情也未授权,Meta当晚未回应置评请求。

09/21 13:53

MiniMax 开源 MiniMax Code:把终端编程智能体交给开发者

据 TechNode 报道,MiniMax 开源了名为 MiniMax Code 的终端编程智能体,开发者可以直接获取并使用这套运行在命令行里的编码工具。把自家编程智能体开放出来,意味着 MiniMax 希望在由头部厂商主导的编程工具竞争中靠开源争取开发者,但仓库地址、许可证与支持范围仍待官方细节确认。

09/21 15:00

OpenAI 扩展 Academy,按五类人群新增学习路径

OpenAI 在其官网宣布扩展 OpenAI Academy,新增多条学习路径,覆盖企业员工、开发者、管理者、教育工作者与学生。官方称这些路径的目标是帮助学习者构建并展示可落地的 AI 实用技能。

09/21 15:00

Kimi K3登陆Amazon Bedrock与阿里云百炼 月之暗面分成模式落地

据观点网9月21日报道,月之暗面的Kimi K3已登陆Amazon Bedrock与阿里云百炼,亚马逊官宣接入该模型,月之暗面与云厂商的分成模式随之正式落地。这意味着Kimi K3的调用入口从模型厂商自有API扩展到了海外与国内两家主流云平台,模型分发与商业化的路径出现新的变化。