GR00T N1

GR00T N1 — открытая модель NVIDIA, которая воспринимает изображения и инструкции и генерирует действия для человекоподобного робота.

GR00T N1 — первая открытая базовая модель NVIDIA для обобщённых навыков человекоподобных роботов. NVIDIA представила её 18 марта 2025 года на GTC. Модель воспринимает изображения и естественно-языковые инструкции, а затем формирует последовательность движений для манипуляций в различных средах. Её можно дообучать на реальных или синтетических данных под конкретный робот и задачу.

Два уровня управления

Планирование и точное движение

Архитектура GR00T N1 сочетает языковизуальную модель и модель действия. Первый компонент интерпретирует изображение и команду, а второй переводит план в непрерывные движения робота. NVIDIA описывает это как двухсистемную схему: одна отвечает за более быстрое действие, другая — за обдуманное выполнение многошаговой инструкции.

Обучение и настройка

Реальные демонстрации и синтетические сцены

Модель обучалась на демонстрациях роботов и синтетических данных, созданных с помощью Omniverse. В официальном анонсе среди примеров названы захват, перемещение предметов двумя руками и последовательное выполнение нескольких действий. Перед применением её необходимо адаптировать и проверить на целевой робототехнической платформе.

Место в линейке GR00T

Последующие версии и смежные модели

GR00T N1 стала основой для N1.5, N1.6 и N1.7. Для физического понимания визуальной сцены NVIDIA развивала семейство Cosmos Reason, включая Cosmos-Reason1.

Связанные модели и разработчик

Карточки внутри экосистемы NVIDIA

GR00T N1.5 · GR00T N1.6 · GR00T N1.7 · Cosmos-Reason1 · NVIDIA в Вики Futuretools

Дата выпуска и первичный источник

Официальные сведения

Пресс-релиз NVIDIA от 18.03.2025 говорит, что GR00T N1 доступна, и описывает входные визуальные и языковые данные, двухкомпонентную архитектуру и задачи манипуляции. Первичный источник: NVIDIA.