郭震 AI公众号:郭震AI

实时 AI 消息

AWS发布Strands机器人数据闭环教程:录制、训练、部署一站打通,数据全程保持LeRobot格式

AWS发布Strands机器人数据闭环教程,用Strands Robots、LeRobot与Hugging Face Storage Buckets实现录制、训练、部署一站式循环。数据全程保持LeRobot格式,训练时从Hub流式读取无需完整下载,字节级去重让重复同步几乎零成本。

发布时间
AWS发布Strands机器人数据闭环教程:录制、训练、部署一站打通,数据全程保持LeRobot格式
图源: huggingface.co

8月13日,AWS在Hugging Face博客发布了一篇完整教程,展示如何用Strands Robots、LeRobot和Hugging Face Storage Buckets跑通一整套机器人数据闭环:录制演示、训练策略、再把策略部署回真实硬件,全程无需转换数据格式。

Strands Robots是AWS开源的SDK(Apache 2.0协议),把机器人抽象、仿真环境和LeRobot技术栈封装成可组合进单个Strands代理的AgentTools。这是该系列的第二篇:上一篇讲数据从Hub流向物理机器人,这一篇反过来,从录制下的第一帧数据一路讲到部署回硬件的策略,Storage Buckets充当中间的工作层。

Hugging Face Storage Buckets是2026年3月发布的存储仓库类型,基于Xet、可变更、不进行版本管理。它与数据集仓库并列存在于同一个hf://命名空间,直接用现有的hf CLI操作,成为“录制当天”到“训练当天”之间数据存放的工作层。

整个循环分四步:Robot("so100")根据自然语言指令录制LeRobotDataset;sync_dataset_to_bucket()把它同步进bucket,并做字节级去重,每次同步只上传发生变化的部分;stream_dataset()直接从Hub流式读回数据训练,无需完整下载,视频帧边读边解码、不留本地副本;训练好的checkpoint只改一个关键字参数(mode="real")就能部署回同一个Robot。

由于同一个Robot()既负责录制又负责回读,数据采集和训练变成了同一后端上的两个方法。磁盘上的数据格式与LeRobot原始输出完全一致,任何能读LeRobot数据的工具无需转换即可读取。目前Hub上已有超过9万个数据集和模型采用LeRobot格式,来自8000多个发布者。

教程的全部环节只需一台笔记本电脑:Python 3.12以上、安装带lerobot扩展的strands-robots>=0.5.1(会自动拉入LeRobot 0.6.1以上),再加上任意Strands兼容的推理服务——Amazon Bedrock、Anthropic API、OpenAI或本地Ollama。配套的可运行notebook位于examples/notebooks/05_streaming_data_loop.ipynb。

演示路径默认在仿真环境中用SO-100机械臂配合mock策略运行,能录出有效数据集但还谈不上实用;不过Robot()工厂本身对接的是机械臂、人形机器人、移动底盘和机械手注册表,这套循环也面向持续采集场景设计:白天收集片段,在增长的数据集上训练,部署,再把下一批数据拉回来改进。

这件事的意义在于,它把过去相互割裂的采集、存储、训练、部署管线压缩成单条代理循环,全程零格式转换。对机器人团队来说,真正的看点在于:流式训练能否省掉足够多的字节搬运和重复拷贝,让“每天用真实机器人数据重训”从例外变成常态。

为什么重要

AWS把机器人数据采集、训练、部署压缩进单条开源代理循环,且与Hub上的LeRobot生态零转换互通,可能显著降低机器人团队日常重训的门槛。

微博邮件

AWSRoboticsLeRobotOpen Source
返回实时消息

附近消息

全部