实时 AI 消息
星尘智能发布 SmoothRL:让在线强化学习跟上机器人的异步执行节奏
星尘智能(Astribot)基座模型团队发布可异步执行的在线强化学习框架 SmoothRL,解决机器人异步执行时模型"计划过的动作"与"真正执行的动作"不一致导致 RL 优化失准的问题。真机测试中,动态投掷、给笔戴帽与开箱任务的成功率分别从 39%、8% 和约 30% 提升至 94%、83% 与 90%。
星尘智能(Astribot)基座模型团队近日发布可异步执行的在线强化学习框架 SmoothRL,技术报告已上线官网研究页(astribot.com/en/research/SmoothRL)。它瞄准的问题很具体:真实机器人没有"暂停键",当 VLA、World-Action Model 一次生成未来一段时间的动作序列(action chunk),模型越大推理越慢,机器人却不能每隔几百毫秒就停下来等模型——尤其在投掷这类高动态任务里,一次停顿就可能让任务失败。
真实部署中更常见的做法是:机器人继续执行手头的动作,模型同时在后台计算下一段。但异步执行打破了"模型生成什么、机器人就执行什么"的对应关系——一整段 action chunk 里,有些动作已经来不及改,有些真正执行了,还有一些根本没有发生。如果强化学习仍把整段动作一起拿来优化,就会"对错账"。SmoothRL 先把这笔账拆清楚:将 action chunk 按执行状态分为 Committed、Execution、Discarded 三个区域,只让价值梯度通过真正执行的 Execution Region。
第二步是让训练和部署遵守同一套时间节奏。SmoothRL 在训练 rollout 中直接运行异步推理,让模型计算与机器人执行并行发生,replay buffer 记录的正是真实时间关系下产生的轨迹。具体实现上,团队以针对各任务微调后的基础策略配合 RLT 骨架,用轻量 TD3-style actor-critic 在原始动作空间预测 residual correction;星尘 S1 以 30 Hz 执行动作、5 Hz 发起推理(每 200 ms 得到一个新的 action chunk),基础策略每次预测 32 帧动作,其中 Committed 与 Execution 共占 12 帧、真正执行的约 6 帧,其余 20 帧在执行前会被后续 chunk 覆盖。
团队在绳驱本体 S1 上验证了高速动态与高精度两类真实部署难题。累计 250 个 rollout episodes 后,动态投掷成功率从基础策略的 39% 提升至 94%;允许约 5 mm 相对位姿误差的给笔戴帽任务从 8% 提升至 83%;用约 1 mm 宽刀片插入仅 2—3 mm 箱盖接缝的开箱任务,学习曲线并非一路上升,150 个 episodes 时一度从 30% 降到 20%,随后回升至 90%。
比成功率更值得注意的是机器人"错法"的改变:RL 之后,投掷时不能根据目标距离正确调节释放速度、刀片持续左偏、对不同笔帽位置动作过于相似等系统性偏差被逐一修正。加入平滑性约束后,在一次真实自主投掷 rollout 中,右侧末端执行器的加速度均方根下降 52%、急动度下降 47%,机器人不仅成功率更高,动作也更平稳、更连续。
这套方法的定位是面向部署的在线后训练,而不是从零教机器人"什么叫开箱"。机器人真正进入真实环境以后,新的问题往往不是完全不会,而是差几毫米、差半拍,或者换一个物体位置就不够稳定。报道也划出了边界——当前使用稀疏的成功/失败奖励,操作员仍可在必要时介入,尚非完全无人参与的"自主进化";每次 chunk 级推理须在预设延迟预算内完成,轻量 residual policy 的表达能力也受冻结基础策略限制。
SmoothRL 由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究。它延续了星尘 Lumo 系列基座模型"为什么这样动"的判断——从 Lumo-1 的显式推理到 Lumo-2 预测世界因动作带来的变化——并与其 Agent 负责交互与调用、基座模型形成通用操作能力、RL 从真实执行中持续修正策略的全栈路线衔接。
团队下一步计划探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。对 Physical AI 而言,SmoothRL 指向一个正在变得越来越具体的部署范式:机器人开始工作以后,训练并没有结束。
为什么重要
SmoothRL 把在线强化学习从"同步世界"假设中解放出来,使其适配真实部署中的异步执行,让机器人投入工作后仍能靠真实反馈持续修正偏差;其与生成式策略端到端优化结合的方向,可能成为 Physical AI 规模化部署的关键一环。
附近消息
全部09/04 17:23
趋境科技与摩尔线程达成战略合作:国产 PD 异构方案已投产,承载真实 AI Token 流量
9月3日,趋境科技与摩尔线程签署战略合作协议,将自研国产 PD 异构技术与 MTT S5000 智算卡、MUSA 软件平台深度融合,推进基于 ATaaS 平台的高品质 AI Token 工厂建设。相关方案已投入生产并承接头部模型厂商的真实 Token 流量,在同等服务标准下兼顾生产级性能与单位 Token 成本优势。
09/04 15:55
智谱正式入驻天猫开官方旗舰店,把GLM Coding Plan摆上电商货架
智谱9月4日正式入驻天猫开设官方旗舰店,上架GLM Coding Plan个人版Lite、Pro、Max及团队版套餐,支持月付、季付和年付,价格与官网一致。这标志着大模型能力正被包装成标准化、可订阅的数字商品,此前智谱披露上半年开放平台与API收入达8.25亿元,占总收入的86.5%。
09/04 13:57
Meta 智能体 Hatch 测试中暴露安全漏洞,可靠性引发关注
Meta 的 AI 智能体 Hatch 在测试阶段暴露出安全漏洞,相关测试结果引发外界对智能体安全性的新一轮关注。漏洞的具体性质与修复安排尚不明朗,Meta 如何回应测试发现将决定 Hatch 后续的发布节奏。
09/04 13:48
千问办公上线首月用户数突破3000万,企业用户占比过半
9月4日,阿里宣布企业级通用Agent产品千问办公上线满一个月,总用户数突破3000万,其中企业用户占比过半。过去一个月该产品完成约120个版本更新,并开源上下文基础设施MyContext,还联合模型团队推出了面向办公场景的专属模型。