Llama 3.1 Nemotron 51B Instruct
Llama 3.1 Nemotron 51B Instruct — модель NVIDIA на базе Llama 3.1 70B, оптимизированная для более быстрого вывода и запуска на одном H100.
Llama 3.1 Nemotron 51B Instruct — инструкционная модель NVIDIA, представленная 23 сентября 2024 года. Она получена из Llama 3.1 70B с помощью поиска архитектуры и дистилляции. NVIDIA проектировала её так, чтобы снизить требования к вычислениям и памяти, сохранив близкие к исходной модели результаты на выбранных компанией тестах.
Модель для текста и инструкций
51 млрд параметров после оптимизации архитектуры
Вместо простого уменьшения числа параметров NVIDIA изменила структуру слоёв: поиск архитектуры определял, какие блоки внимания и прямого распространения можно сократить, а дистилляция переносила поведение более крупной модели. В официальной публикации NVIDIA указывала, что версия рассчитана на запуск на одном H100 при высокой нагрузке.
Производительность и практические ограничения
Сравнение только в условиях теста NVIDIA
В описанной NVIDIA конфигурации скорость генерации была примерно в 2,2 раза выше, чем у Llama 3.1 70B Instruct, при близких оценках на выбранных тестах. Эти цифры измерялись с TensorRT-LLM, квантованием FP8 и заданными длинами входа и выхода; они не являются универсальной гарантией для других GPU, серверов или программных стеков.
Другие размеры Llama Nemotron
От компактной Nano к более крупным моделям
Для настольных систем и периферийных устройств позже появилась Llama Nemotron Nano 8B. В 2025 году NVIDIA также представила Super 49B и Ultra 253B — модели с другими балансами вычислительной стоимости и качества.
Дата выпуска и первичный источник
Подтверждение NVIDIA
Технический блог NVIDIA опубликован 23.09.2024; он подтверждает название 51B Instruct, происхождение от Llama 3.1 70B, NAS и дистилляцию, а также результаты производительности в конкретных условиях испытаний на H100. Официальный материал: NVIDIA.
Сведения о разработчике и его моделях: NVIDIA в Вики Futuretools.ru.