Llama 3.1 Nemotron 51B Instruct

Llama 3.1 Nemotron 51B Instruct — модель NVIDIA на базе Llama 3.1 70B, оптимизированная для более быстрого вывода и запуска на одном H100.

Llama 3.1 Nemotron 51B Instruct — инструкционная модель NVIDIA, представленная 23 сентября 2024 года. Она получена из Llama 3.1 70B с помощью поиска архитектуры и дистилляции. NVIDIA проектировала её так, чтобы снизить требования к вычислениям и памяти, сохранив близкие к исходной модели результаты на выбранных компанией тестах.

Модель для текста и инструкций

51 млрд параметров после оптимизации архитектуры

Вместо простого уменьшения числа параметров NVIDIA изменила структуру слоёв: поиск архитектуры определял, какие блоки внимания и прямого распространения можно сократить, а дистилляция переносила поведение более крупной модели. В официальной публикации NVIDIA указывала, что версия рассчитана на запуск на одном H100 при высокой нагрузке.

Производительность и практические ограничения

Сравнение только в условиях теста NVIDIA

В описанной NVIDIA конфигурации скорость генерации была примерно в 2,2 раза выше, чем у Llama 3.1 70B Instruct, при близких оценках на выбранных тестах. Эти цифры измерялись с TensorRT-LLM, квантованием FP8 и заданными длинами входа и выхода; они не являются универсальной гарантией для других GPU, серверов или программных стеков.

Другие размеры Llama Nemotron

От компактной Nano к более крупным моделям

Для настольных систем и периферийных устройств позже появилась Llama Nemotron Nano 8B. В 2025 году NVIDIA также представила Super 49B и Ultra 253B — модели с другими балансами вычислительной стоимости и качества.

Дата выпуска и первичный источник

Подтверждение NVIDIA

Технический блог NVIDIA опубликован 23.09.2024; он подтверждает название 51B Instruct, происхождение от Llama 3.1 70B, NAS и дистилляцию, а также результаты производительности в конкретных условиях испытаний на H100. Официальный материал: NVIDIA.

Сведения о разработчике и его моделях: NVIDIA в Вики Futuretools.ru.