NVIDIA Llama 3.1 Nemotron 8B UltraLong 1M Instruct

NVIDIA Llama 3.1 Nemotron 8B UltraLong 1M Instruct — модель на базе Llama 3.1 с контекстом до 1 млн токенов.

Llama 3.1 Nemotron 8B UltraLong 1M Instruct — инструкционная языковая модель NVIDIA на базе Llama 3.1 8B Instruct. Её отличительный параметр — контекстное окно до 1 млн токенов. Модель входит в серию UltraLong, где NVIDIA выпустила три версии с окнами в 1, 2 и 4 млн токенов. Это вариант для задач, в которых системе нужно учитывать существенно больший объём текста, чем помещается в обычный короткий запрос.

Назначение и длина контекста

Для чего предназначена версия 1 млн токенов

Версия 1M имеет наименьшее заявленное окно в семействе, но это не означает, что её запуск не требует значительных ресурсов. Фактическое потребление памяти и задержка зависят от длины входа, точности весов, числа одновременных запросов и программного движка. Максимальная длина — верхняя граница контекста модели, а не рекомендация всегда передавать миллион токенов.

База модели и обучение

Инструкционная настройка на Llama 3.1 8B

Для версии 1M NVIDIA указывает продолжение предварительного обучения на корпусе объёмом 1 млрд токенов: последовательности длиной 1 млн токенов, 125 итераций и глобальный размер пакета 8. Затем модель прошла инструкционную настройку ещё на 1 млрд токенов из открытых наборов для общих, математических и программных задач. В карточке NVIDIA сказано, что часть данных взята из набора general_sft_stage2 проекта AceMath-Instruct.

Оценка длинного контекста

Что измеряли в материалах NVIDIA

NVIDIA описывает оценку на тестах длинного контекста RULER, LV-Eval и InfiniteBench, а также на стандартных наборах MMLU, MATH, GSM8K и HumanEval. Производитель сообщает о конкурентных результатах на общих тестах и сильных результатах на длинном контексте; конкретный результат зависит от тестового набора и конфигурации. Само число 1M не доказывает, что любая информация будет извлечена безошибочно из любого объёма текста.

Как выбрать вариант UltraLong

Сравнение контрольных точек семейства

NVIDIA опубликовала три варианта UltraLong-8B: 1M, 2M и 4M. Варианты используют одну базовую модель и общий подход к обучению, но различаются предельной длиной обучающей последовательности и контекстным окном. Практический выбор следует связывать с реальным размером входных данных и ресурсами развёртывания, а не только с максимальным числом в названии.

Лицензия и ограничения

Условия некоммерческого использования

Модельные карточки указывают лицензию CC-BY-NC-4.0. Обозначение NC ограничивает коммерческое использование; организациям следует изучить полный текст лицензии и условия Meta для базовой модели до включения чекпойнта в коммерческий продукт. Доступность открытых весов не означает отсутствие лицензионных ограничений.

Связанные модели и разработчик

Серия NVIDIA Nemotron-UltraLong

NVIDIA Llama 3.1 Nemotron 8B UltraLong 2M Instruct · NVIDIA Llama 3.1 Nemotron 8B UltraLong 4M Instruct · Llama 3.1 8B Instruct · NVIDIA в Вики Futuretools

Публичный выпуск и первичные источники

Страница проекта и карточка весов

Страница NVIDIA ADLR датирует публикацию проекта 14 апреля 2025 года и перечисляет все три контрольные точки. Дата в каталоге относится к этой официальной публикации; история репозиториев Hugging Face содержит более ранние служебные коммиты и позднейшие обновления, поэтому не трактуется как отдельная дата публичного анонса. Идентификатор контрольной точки NVIDIA — `nvidia/Llama-3.1-Nemotron-8B-UltraLong-1M-Instruct`. В карточке указано максимальное окно 1 млн токенов, база Llama 3.1 8B Instruct и лицензия CC-BY-NC-4.0. Проект NVIDIA: From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models. Карточка модели: Llama-3.1-Nemotron-8B-UltraLong-1M-Instruct.