Hugging Face 开源机器人学框架 LeRobot 更新至 0.6.0,新增想象、评估、改进等核心能力,推进开源机器人学生态发展。
LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),它们学会想象未来;推出了一波新的 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT);以及新的奖励模型 API(Robometer、TOPReward)。此外还提供了六个新的仿真基准测试统一在 lerobot-eval 下;带有 DAgger 式人在回路修正的 lerobot-rollout CLI;FSDP 训练;以及 HF Jobs 上的云训练。数据集获得深度支持、自动语言标注流程、自定义视频编码和高达 2 倍的数据加载速度提升,所有这些都在更精简的安装基础上实现。
机器人学界正在思考一个大问题:世界模型是否真的能帮助机器人策略?v0.6.0 为 LeRobot 带来了三个策略来帮助回答这个问题。每一个都在训练中学会想象未来,每一个都采取不同的路径来保持这种想象的成本可承受。
VLA-JEPA 教导一个紧凑的 VLA(基于 Qwen3-VL-2B 构建)在学习行动的同时在潜在空间中预测未来:在训练过程中,JEPA 世界模型必须从模型自身的行动中预测即将到来的帧。技巧是世界模型在推理时消失,所以你以零额外推理成本获得世界模型监督。三个现成的检查点在 Hub 上,包括一个 DROID 预训练的基础供微调:
lerobot-train \
--policy.path=lerobot/VLA-JEPA-Pretrain \
--dataset.repo_id=${HF_USER}/my_dataset \
--policy.repo_id=${HF_USER}/my_finetuned_policy
查看 VLA-JEPA 文档和论文以了解更多信息。
LingBot-VA 更进一步:一个自回归视频-动作模型,逐块预测未来视频和动作,并将真实观察反馈进来以保持其想象与现实相符。你甚至可以保存机器人想象的内容(--policy.save_predicted_video=true)并将其与实际发生的情况进行比较。推理在单个 24–32 GB GPU 上运行。查看文档和论文以了解技术细节。
FastWAM 在其论文标题中提出了一个问题:世界动作模型需要测试时间的未来想象吗?它在单个网络中配对了一个 ~5B 视频生成专家和一个紧凑的动作专家,所以模型字面上学会了梦想自己的展开。在推理时,它完全跳过梦想阶段,直接对动作块进行去噪。从 lerobot/fastwam_base 微调它,并在文档中阅读更多信息。
我们将 NVIDIA GR00T 集成升级到 GR00T N1.7,这是 NVIDIA 跨具身基础模型的最新开放代。N1.7 用 Cosmos-Reason2-2B(基于 Qwen3-VL 构建)交换了之前的 VLM,并馈送到流匹配动作头,我们的集成已根据 NVIDIA 的原始 Isaac-GR00T 实现进行了奇偶性测试:相同的输入,相同的输出。Flash-attention 现在是可选的,所以 pip install 'lerobot[groot]' 就能正常工作,你可以直接加载 NVIDIA 发布的检查点。
GR00T N1.7 在 LeRobot 中替代了 N1.5。如果需要 N1.5,请固定 lerobot==0.5.1。
MolmoAct2 是 Allen Institute for AI 的视觉-语言-动作模型,现已移植到 LeRobot,覆盖完整的生命周期:微调(完全或 LoRA)、评估和实机器人部署。预制的检查点内置了校准修正,意味着你可以在 SO-100/101 上零样本运行它:
lerobot-rollout \
--policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \
--task="pick up the red cube" --duration=30
推理适应 ~12 GB 的 bf16,LoRA 微调适应单个 24 GB GPU。有关完整部署指南,请参阅 MolmoAct2 文档。
EO-1 是一个在交错的视觉-文本-动作数据上上游预训练的 VLA,加入了 LeRobot:一个 Qwen2.5-VL-3B 骨干网络配合流匹配动作头,由论文的作者之一贡献。使用标准 lerobot-train 工作流用 --policy.type=eo1 训练它。详情请参阅文档和论文。
Multitask Diffusion Transformer 策略将 TRI Large Behavior Models 的配方带到 LeRobot:一个 ~450M 参数的扩散 Transformer,以 CLIP 视觉和语言嵌入为条件,因此一个模型学习许多通过自然语言选择的任务。它支持扩散和流匹配目标,小到可以自己训练。查看文档。
VLA 不一定要很大。EVO1 将其策略打包成 0.77B 参数,一个 InternVL3-1B 骨干网络配合流匹配动作头,小到足以在普通 GPU 上进行微调和实时运行。它开箱即用地支持两阶段微调和实时分块。查看 EVO1 文档和论文。
成功检测和进度估计是机器人学习循环中缺失的部分,v0.6.0 为它们提供了一个家。LeRobot 现在有一个统一的奖励模型 API (lerobot.rewards),镜像策略 API,在一个界面后面有四个奖励模型 - HIL-SERL 奖励分类器、SARM 和两个新的补充:
Robometer 是一个预训练的通用奖励模型:指向 lerobot/Robometer-4B 至任何 LeRobot 数据集,它从原始视频加语言指令中评分任务进度和成功,不需要任务特定的训练。它基于 Qwen3-VL-4B 构建,通过超过一百万个机器人轨迹的数据集上的轨迹比较进行训练(RSS 2026 论文)。
TOPReward 完全零样本:根本没有奖励权重。它包装了一个现成的 VLM (Qwen3-VL),并读取给定轨迹视频和任务指令下令牌"True"的对数概率。任何能够的 VLM 都可以成为奖励函数。
两者都附带标签脚本,将每帧进度曲线写入你的数据集,为奖励感知行为克隆 (RA-BC)、数据集质量检查和进度覆盖视频做准备。查看 Robometer 和 TOPReward 文档。
记录不再局限于一个硬编码的编码器。新的 --dataset.rgb_encoder.* 选项公开了完整的编码表面(编码器、质量、像素格式、GOP、预设),vcodec=auto 探测 NVENC、VideoToolbox、VAAPI 和 QSV 等硬件编码器,然后回落到默认的软件 AV1 编码器。对于现有数据集,一条命令重新编码所有内容:
lerobot-edit-dataset \
--repo_id ${HF_USER}/my_dataset \
--operation.type reencode_videos \
--operation.rgb_encoder.vcodec h264 \
--operation.rgb_encoder.crf 23
视频编码文档中的完整详情。
连接 Intel RealSense,设置 use_depth: true,LeRobot 端到端记录深度图:以毫米捕获,压缩为紧凑的 12 位深度视频流,与 RGB 摄像机并行,在训练时解码回物理单位。深度在记录过程中和 lerobot-dataset-viz 中实时渲染,它适用于 SO-100/101、Koch、OpenArm、reBot、Unitree G1 等。
你的数据集不再只是每个片段一个任务字符串。LeRobot 数据集现在原生存储丰富的语言标注(时戳子任务、计划、记忆、纠正、语音和每摄像头的 VQA 对),新的 lerobot-annotate CLI 使用观看你的片段的 VLM 自动填充它们:
lerobot-annotate \
--repo_id=${HF_USER}/my_dataset \
--new_repo_id=${HF_USER}/my_dataset_annotated \
--vlm.model_id=Qwen/Qwen2.5-VL-7B-Instruct \
--push_to_hub=true
YAML 配方层然后在采样时把这些标注渲染为聊天式训练消息:恰好是明天的长地平线、会说话的机器人策略将训练的数据。用 HF Jobs 扩展它,并阅读标注管道文档了解更多。
视频数据集上的训练现在开箱即用快 ~2 倍:多摄像头帧并行解码,数据加载器工作进程传输紧凑的 uint8 帧(进程间内存减少 4 倍),持久化工作进程在整个 epoch 中保持解码器缓存活跃。加载大数据集的子集(episodes=[...])从数分钟降到毫秒级(我们的基准测试中从 275 秒降到 0.06 秒)。采样现在也是确定性的且可恢复的,所以中断的训练会从样本精确处重启。
v0.5.0 在 LeRobot 作为 VLA 评估中心的旗帜上插了一杆;v0.6.0 用六个新的模拟基准测试使其成为现实,全部可通过相同的 lerobot-eval CLI 运行,每个都有文档页面、Docker 镜像和在 CI 中冒烟测试的 SmolVLA 基准检查点:
LIBERO-plus 使用大约 10,000 个在七个轴上的 LIBERO 扰动变体(从照明和摄像头视点到重写的指令)对 VLA 进行压力测试。它告诉你一个策略何时会崩溃。
RoboTwin 2.0 在 SAPIEN 上涵盖 50 个双臂操作任务,具有大量域随机化,并在 Hub 上提供超过 100k 现成可训练的轨迹。
RoboCasa365 跨 2,500 个程序生成的厨房在移动操作机上跨越 365 个厨房任务,是我们阵容中最大的任务表面。
RoboCerebra 用链接 3 到 6 个子目标的片段(带有语言接地的中间指令)以及 6,660 片段数据集评估长地平线行为。
RoboMME 是一个记忆考试:你的策略能计数重复、追踪隐藏物体和模仿演示的程序吗?4 个记忆套件上 16 个任务。
VLABench 测试操作中的知识和推理,从物理问题到复合任务如端到端冲泡咖啡。
lerobot-eval \
--policy.path=lerobot/smolvla_robotwin \
--env.type=robotwin \
--env.task=beat_block_hammer \
--eval.n_episodes=100 --eval.batch_size=1
模拟器后端需要具有其自身安装步骤的特定系统依赖项;每个文档页面都有确切的配方,如果你想跳过设置,每个基准都附带现成的 Docker 镜像。
结合 LIBERO、Meta-World 和 NVIDIA IsaacLab-Arena,这使得一个屋顶下有九个基准族,一个新的《添加新基准》指南准确记录如何插入你的。评估也变得更快:并行评估现在默认采用异步向量化环境,基准测试速度提升最高 2 倍。
部署策略曾经是 lerobot-record 之上的一个 hack。新的 lerobot-rollout CLI 使部署成为自己的工作流,具有可插拔策略和推理后端(包括用于慢兼容 VLA 的实时分块)。基础策略只运行策略。sentry 持续记录,轮转片段并上传到 Hub。highlight 保持环形缓冲区,当你按下一个键时保存最后 N 秒,这样有趣的时刻永远不会丢失。episodic 镜像经典的 episode/reset 记录工作流。dagger 将部署转化为数据收集。
使用 DAgger 策略,你观看你的策略运行,在它出错的那一刻按下一个键(或一个 USB 脚踏板),用你的主臂接管以记录纠正,然后交还控制权。执行驱动程序在你接管之前被驱动到跟随者的姿态,所以交接是无冲击的。每个纠正帧都用干预标志标记,结果数据集为下一次微调做好准备:
lerobot-rollout \
--strategy.type=dagger \
--policy.path=${HF_USER}/my_policy \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--teleop.type=so101_leader \
--teleop.port=/dev/ttyACM1 \
--dataset.repo_id=${HF_USER}/dagger_corrections \
--dataset.single_task="Grasp the block"
部署、收集纠正、微调、重复:机器人学习飞轮现在是一个 CLI 标志。阅读部署文档。
机器人基础模型正在超越单个 GPU。LeRobot 训练现在通过 Accelerate 支持 FSDP(完全分片数据并行):参数、梯度和优化器状态分片在 GPU 上,检查点被重新收集到一个纯单文件 model.safetensors 中,加载时就像任何其他策略一样。你甚至可以在不同数量的 GPU 上恢复 FSDP 运行。见多 GPU 训练文档。
没有 GPU?没问题。完全相同的 lerobot-train 命令现在通过添加一个标志在云中运行:
lerobot-train \
--dataset.repo_id=${HF_USER}/so101_test \
--policy.type=act \
--policy.repo_id=${HF_USER}/my_policy \
--job.target=a10g-small
LeRobot 如果需要将你的本地数据集推送到私有 Hub 仓库,提交作业,将日志流式传输到你的终端,并在末尾将训练的策略推送到 Hub。用 --job.target 选择从 T4 到 8x H200 的任何东西(计算按使用量计费)。查看文档
pip install lerobot 现在真正轻量级,基础依赖项大约减少 40%。功能作用域的 extras([training]、[core_scripts]、[evaluation]、...)涵盖其余部分,缺失依赖错误告诉你准确要添加哪个 extra。如果你只使用 LeRobot 数据集,不再需要安装硬件相关依赖项 ;)
支持的 PyTorch 移动到 2.7–2.11,CUDA 12.8 wheels 为 Linux uv 安装开箱预设。--policy.dtype=bfloat16 现在通过 Accelerate 驱动真实混合精度训练。
一个承诺的 uv.lock 是 CI、Docker 和开发的权威依赖规范,文档包括每一步的 uv 安装路线,直到用单个标志选择你的 CUDA wheel。
--display_mode=foxglove 将遥操作、记录和运行流式传输到 Foxglove,这个可视化工具是机器人世界大部分已经在使用的。它适用于远程设置,lerobot-dataset-viz 获得可刮除的数据集播放。
可 pip 安装的 lerobot_env_* 包现在自动注册其环境。插件系统涵盖所有五个组件类型:机器人、摄像头、遥操作员、策略和环境。
键盘控制在记录期间现在在 Wayland、SSH 上、在无头设备上以及在 macOS 上无需可访问性权限工作。
查看发布说明了解完整列表和重大变化的迁移指针。
LeLab 把整个 LeRobot 工作流(校准、遥操作、记录、本地或 HF Jobs 上训练、部署)放在浏览器 UI 中,无需 CLI。它目前支持 SO-ARM101。尝试一下!
Isaac Teleop 让你通过 NVIDIA 的 Isaac Teleop 堆栈在 CloudXR/OpenXR 上用 VR 控制器遥操作 SO-101,这是与 NVIDIA 团队的协作成果。见文档。
新的计算硬件指南回答了每个新手问的两个问题:我需要哪个 GPU,训练需要多长时间?它给出了从 RTX 4090 到 4x H100 的每个策略族的测量 VRAM 包络和参考训练时间。
重写的《添加策略指南》展示了如何发布你自己的策略,在树内或作为无需 PR 的插件包。
除了这些头条功能外,v0.6.0 包括数百个错误修复、文档改进和整个代码库的生活质量升级,从更智能的默认值到更可靠的 CI。
我们要感谢社区中的每个人。这个发布包括来自学术界、工业界和爱好者团队的工作,他们选择 LeRobot 作为他们的模型和基准的家园。每个 PR 和错误报告都推动了开源机器人学的发展。
敬请期待更多内容 🤗 从这里开始!– LeRobot 团队 ❤️