New-ZZZ
RU / EN
Робототехника 20 июля 2026

NVIDIA переносит моделирование мира в реальном времени на периферийные робототехнические системы

Р
Редакция New-ZZZ
Hugging Face Blog · 2 недели назад

NVIDIA выпустила Cosmos 3 Edge в репозитории Cosmos 3 на Hugging Face. Открытая модель насчитывает 4 миллиарда параметров и предназначена для машин, работающих за пределами дата-центров, включая роботов и системы ИИ с компьютерным зрением на заводах, складах, в больницах и других физических средах. Её главная цель — обеспечить устройствам с ограниченным объёмом памяти развитые возможности восприятия, рассуждения, прогнозирования и генерации действий. NVIDIA представляет Cosmos 3 Edge как компактную модель, которая переносит понимание мира и управление роботами непосредственно на периферийное оборудование, снижая необходимость отправлять каждое решение на удалённый сервер.

Модель может работать как компактная визуально-языковая модель, интерпретируя визуальные наблюдения вместе с текстовыми инструкциями и поддерживая инференс в реальном времени. По словам NVIDIA, она обеспечивает эффективное использование памяти и высокую пропускную способность на всей линейке периферийных вычислительных решений компании, включая графические процессоры RTX PRO и GeForce RTX, системы DGX, а также устройства Jetson, такие как недавно анонсированные модули Jetson T2000 и T3000. Будучи дообученной моделью действий в мире, она обрабатывает наблюдения робота с разрешением 640×360 пикселей. На Jetson Thor модель способна генерировать 32 действия за один инференс и обеспечивать управление роботом в реальном времени с частотой 15 Гц, то есть контур управления может обновляться 15 раз в секунду.

По данным NVIDIA, Cosmos 3 Edge занимает первое место в VANTAGE-Bench по анализу визуальных данных среди моделей сопоставимого размера — около 4 миллиардов параметров. Компания также называет её показатели в обучении политик управления роботами передовыми. Эти заявления позиционируют модель как общую основу как для приложений умной инфраструктуры, в которых системы анализируют активность в физическом мире, так и для робототехники, где восприятие необходимо связывать с конкретными движениями.

Модель мира не ограничивается распознаванием объектов на изображении. Она обучается представлению того, как среда изменяется со временем, включая объекты, движение, пространственные отношения и последствия действий. Например, робот, получивший задание взять объект, должен распознать его, определить его положение, отслеживать движение своего захвата, предвидеть, что произойдёт при контакте, и выбрать действие, которое с наибольшей вероятностью позволит выполнить задачу. Модель мира может предсказывать визуальный результат действия, определять, какое действие вызвало наблюдаемое изменение, или предлагать действие, которое должно привести к желаемому результату.

Cosmos 3 Edge объединяет текущее состояние среды, возможные будущие состояния и связывающие их действия в едином представлении непосредственно на устройстве. Благодаря этому физическая система ИИ может рассуждать о происходящем сейчас, моделировать возможное развитие событий и решать, как её поведение способно повлиять на будущее. Таким образом, одну и ту же модель можно использовать для понимания сцены, прямого прогнозирования, определения действий и генерации политик, вместо того чтобы рассматривать эти задачи как полностью независимые.

В основе архитектуры Cosmos 3 лежат две трансформерные башни. Авторегрессионная башня обрабатывает визуальные и текстовые токены для понимания и пошагового рассуждения. Диффузионная башня работает с визуальными, аудиотокенами и токенами действий для прогнозирования, генерации и нейронного моделирования. Башни сохраняют раздельные слои нормализации и многослойные перцептроны, но совместно используют мультимодальные слои внимания. Эти общие слои согласуют информацию между языком, видео, аудио и действиями, предоставляя системе единую основу для интерпретации инструкций и физических изменений.

Архитектура также применяет разные схемы внимания к различным типам информации. Языковые токены используют причинное внимание, поэтому каждый токен может учитывать предшествующие ему токены. Диффузионные токены могут шире учитывать доступный контекст, обеспечивая согласованное прогнозирование и генерацию. В зависимости от задачи авторегрессионная часть может создавать токены рассуждений, а диффузионная — генерировать очищенные от шума токены видео или действий. Такая организация позволяет Cosmos 3 рассуждать о сцене перед формированием прогноза или управляющего сигнала.

Физические машины описывают движение по-разному: транспортное средство может использовать собственную позу и траекторию, движущаяся камера — параметры движения камеры, роботизированная рука опирается на позу своего рабочего органа, а захвату дополнительно необходимо представлять, открыт он, закрыт или удерживает объект. Cosmos 3 отображает эти различные формы физического воплощения в единое представление действий. Действия кодируются в виде компактных геометрических векторов, создавая прямую связь между управляющими сигналами и видимыми изменениями среды.

Благодаря этой связи сгенерированное видео становится не просто визуальным прогнозом. Оно может показывать, как физический мир, предположительно, изменится в ответ на определённое действие, позволяя обучающим примерам отражать движение, управление и причинно-следственные связи. При использовании в качестве политики модель предсказывает как действие, так и его ожидаемое визуальное последствие: на вход поступает текущее состояние, а на выходе формируются рекомендуемое поведение и симуляция вероятного следующего состояния. Информация о действиях может передаваться и в обратном направлении, позволяя модели определять действие по его наблюдаемым последствиям.

NVIDIA также выпускает Cosmos 3 Edge Policy (DROID) — политику манипулирования, дообученную на наборе данных DROID для задач захвата и перемещения объектов, а также скрипты для дополнительного дообучения. В примере инструкции от NVIDIA роботу предлагается взять банан и положить его на тарелку. Сопутствующий инструментарий предназначен для того, чтобы разработчики могли адаптировать модель к практическим задачам манипулирования, используя такую инфраструктуру, как небольшой кластер графических процессоров H100 или NVIDIA DGX Station.

Почему это важно

  • Выполнение задач восприятия, рассуждения и генерации действий непосредственно на устройстве может снизить задержку и уменьшить зависимость роботов от подключения к центрам обработки данных.
  • Единая модель для зрения, языка, симуляции и управления может упростить разработку и оценку политик поведения роботов.
  • Открытая публикация предоставляет разработчикам компактную базовую модель и инструменты постобучения для адаптации систем физического ИИ.

Ключевые факты

  • Cosmos 3 Edge — открытая модель мира и действий с 4 млрд параметров, доступная в репозитории NVIDIA Cosmos 3 на Hugging Face.
  • Модель поддерживает визуально-языковое рассуждение, прогнозирование визуальных сцен и генерацию действий робота на периферийном оборудовании NVIDIA.
  • На Jetson Thor она обрабатывает наблюдения с разрешением 640×360, генерирует 32 действия за один вывод и поддерживает управление с частотой 15 Гц.
  • По данным NVIDIA, модель занимает первое место в VANTAGE-Bench по видеоаналитике среди сопоставимых моделей с 4 млрд параметров.
  • Cosmos 3 Edge Policy (DROID) и скрипты её постобучения предназначены для роботизированных операций захвата и перемещения объектов.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы