LeRobot 0.6.0 добавляет world models, VLA и унифицированную оценку роботов
LeRobot v0.6.0 — крупный релиз для робототехники, сфокусированный на трёх практических целях: помочь роботизированным политикам представлять, что может произойти дальше, оценивать их более последовательно и улучшить рабочий процесс обучения и развёртывания вокруг них. Релиз добавляет несколько политик на основе world models, расширяет набор vision-language-action моделей, вводит поддержку reward models, обновляет датасеты и добавляет новые симуляционные бенчмарки под единым интерфейсом оценки. Проще говоря, LeRobot пытается упростить создание роботов, которые могут учиться на зрении, языке, действиях и обратной связи, без необходимости каждой лаборатории заново собирать один и тот же инструментарий.
Главная тема — world models: роботизированные политики, которые во время обучения формируют внутреннее представление о будущем. VLA-JEPA, LingBot-VA и FastWAM исследуют один и тот же ключевой вопрос: может ли робот действовать лучше, если научится представлять вероятные будущие наблюдения и действия? VLA-JEPA использует компактную vision-language-action модель на базе Qwen3-VL-2B и обучает её с world model в стиле JEPA, которая предсказывает будущие кадры в скрытом представлении, а не в сырых пикселях. Важная инженерная деталь в том, что этот дополнительный компонент world model используется во время обучения, но удаляется на этапе инференса, поэтому робот получает пользу от обучения на предсказании будущего без дополнительных runtime-затрат. Релиз также включает готовые к использованию чекпоинты, включая базу, предобученную на DROID и предназначенную для fine-tuning.
LingBot-VA идёт более прямым путём: он предсказывает будущие видео и действия вместе, фрагмент за фрагментом. Это autoregressive video-action model, то есть она генерирует следующую часть последовательности на основе того, что было раньше, а затем снова использует реальные наблюдения, чтобы не дать предсказаниям слишком далеко уйти от реальности. LeRobot также предоставляет опцию сохранять предсказанное видео, позволяя разработчикам сравнивать, что робот ожидал увидеть, с тем, что произошло на самом деле. Это делает модель полезной не только для управления, но и для отладки. В источнике отмечается, что инференс может выполняться на одном GPU с 24–32 GB памяти, что важно, поскольку у многих команд в робототехнике нет неограниченного аппаратного бюджета.
FastWAM подходит к той же задаче через world action model. Он объединяет примерно 5B-параметрический эксперт по генерации видео с меньшим экспертом действий в одной сети, чтобы система училась rollout’ам во время обучения. Однако на этапе инференса он не тратит время на генерацию воображаемого будущего. Вместо этого он напрямую денойзит фрагменты действий робота. Это продолжает практический паттерн релиза: использовать более богатое предсказание во время обучения, но сохранять развёртывание достаточно эффективным для реальных систем.
Релиз также расширяет набор VLA-моделей LeRobot. Интеграция NVIDIA GR00T обновлена до GR00T N1.7, заменив N1.5 в текущей линейке LeRobot. N1.7 использует Cosmos-Reason2-2B, построенную на Qwen3-VL, и подаёт данные в flow-matching action head. Интеграция проверена на паритет с реализацией NVIDIA Isaac-GR00T, то есть одни и те же входные данные должны давать одни и те же выходные данные. Flash-attention теперь опционален, что упрощает установку, а опубликованные NVIDIA чекпоинты можно загружать напрямую. Для команд, которым всё ещё нужна N1.5, источник говорит закрепить LeRobot на версии 0.5.1.
MolmoAct2 от Allen Institute for AI теперь доступен внутри LeRobot с поддержкой fine-tuning, оценки и развёртывания на реальных роботах. Он поддерживает как полный fine-tuning, так и LoRA — более лёгкий метод, который настраивает меньшее число параметров модели. Готовые чекпоинты включают calibration correction и могут использоваться zero-shot на роботах SO-100/101. Заявленные требования к железу тоже практичны: инференс помещается примерно в 12 GB при точности bf16, а LoRA fine-tuning помещается на один GPU с 24 GB памяти. EO-1 также добавлен в библиотеку: он использует backbone Qwen2.5-VL-3B и flow-matching action head, а обучать его можно через стандартный workflow lerobot-train.
LeRobot v0.6.0 добавляет не только политики. Новый API reward models даёт разработчикам способ оценивать, добился ли робот успеха, используя модели вроде Robometer и TOPReward. Это важно, потому что оценка в робототехнике часто зависит от неаккуратных real-world результатов, а не от простых меток. Reward models могут помогать оценивать прогресс, направлять обучение и сравнивать поведение между задачами. Релиз также объединяет шесть новых симуляционных бенчмарков под lerobot-eval, давая командам единый command-line путь для оценки вместо отдельных benchmark-specific процессов.
Датасеты получили несколько улучшений удобства и возможностей. Релиз добавляет end-to-end поддержку depth, так что датасеты могут включать информацию о глубине вместе с обычными изображениями. Он вводит автоматический pipeline языковой аннотации, который может помогать превращать робототехнические данные в более богатый обучающий материал, добавляя текстовые описания в масштабе. Также он позволяет настраивать кодирование видео, чтобы команды могли выбирать кодеки под свои требования к хранению, скорости или качеству. Загрузка данных описывается как ускоренная до двух раз, что является существенным улучшением, поскольку обучение роботов часто упирается в большие датасеты с большим количеством видео.
Инструменты обучения и развёртывания тоже стали сильнее. Новый CLI lerobot-rollout даёт развёртыванию собственный command-line инструмент и поддерживает human-in-the-loop correction в стиле DAgger. DAgger — это метод обучения, при котором человек может корректировать робота во время его действий, создавая лучшие примеры из ситуаций, с которыми робот реально сталкивается. Поддержка FSDP позволяет обучать модели больше, чем обычно помещается на один GPU, распределяя работу между устройствами, а cloud training через Hugging Face Jobs даёт командам ещё один путь, когда локального железа недостаточно.
В целом LeRobot v0.6.0 выглядит как консолидационный релиз для современного обучения роботов. Он переносит передовые исследовательские идеи, такие как world models, VLA, reward models, diffusion-style policies и flow-matching action heads, в более единый открытый стек для робототехники. Практический вывод в том, что разработка робототехники движется от изолированных демонстраций моделей к переиспользуемой инфраструктуре для обучения, оценки, корректировки и развёртывания embodied AI systems.
Почему это важно
- —Релиз упрощает обучение, сравнение и развертывание продвинутых методов robot learning в едином открытом стеке.
- —Политики на основе world models могут помочь роботам лучше обучаться поведению, предсказывая будущие результаты во время тренировки.
- —Унифицированные бенчмарки, reward models, более быстрые датасеты и облачное обучение снижают трение для команд в робототехнике.
Ключевые факты
- LeRobot v0.6.0 вводит политики world model, включая VLA-JEPA, LingBot-VA и FastWAM.
- Model zoo для VLA теперь включает GR00T N1.7, MolmoAct2, EO-1, Multitask DiT и EVO1.
- Новый API reward models поддерживает системы вроде Robometer и TOPReward.
- Шесть симуляционных бенчмарков объединены в lerobot-eval, а для развертывания добавлен CLI lerobot-rollout.
- Датасеты получили поддержку глубины, автоматическую языковую аннотацию, пользовательское кодирование видео и загрузку до 2 раз быстрее.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.