NVIDIA Llama 3.1 Nemotron 8B UltraLong 2M Instruct

NVIDIA Llama 3.1 Nemotron 8B UltraLong 2M Instruct — вариант семейства с контекстным окном до 2 млн токенов.

Llama 3.1 Nemotron 8B UltraLong 2M Instruct — инструкционная модель NVIDIA с контекстным окном до 2 млн токенов. Она построена на Llama 3.1 8B Instruct и относится к линейке Nemotron-UltraLong. В этой линейке 2M занимает промежуточное место между вариантами на 1 млн и 4 млн токенов; отдельная контрольная точка позволяет выбрать именно этот предел контекста, а не менять длину окна у одной и той же опубликованной модели.

Назначение и длина контекста

Для чего предназначена версия 2 млн токенов

Окно 2M рассчитано на обработку особенно длинных входов: например, нескольких связанных документов или объёмного материала в одном запросе, если выбранный движок поддерживает такую длину. Польза зависит от того, действительно ли задача требует единого длинного контекста. С ростом входа увеличиваются вычислительная нагрузка и потребление памяти; фактические показатели зависят от платформы, точности весов и реализации.

База модели и обучение

Инструкционная настройка на Llama 3.1 8B

По карточке модели, для обучения длинному контексту NVIDIA использовала продолжение предварительного обучения на 1 млрд токенов, включая последовательности длиной до 2 млн токенов. Указаны 245 шагов обучения и глобальный размер пакета 2. После этого применялась инструкционная настройка на 1 млрд токенов из открытых наборов общего назначения, математики и программирования; среди источников названа выборка general_sft_stage2 проекта AceMath-Instruct.

Оценка длинного контекста

Что измеряли в материалах NVIDIA

В материалах NVIDIA длинноконтекстную способность оценивали на RULER, LV-Eval и InfiniteBench; отдельно приводятся стандартные тесты MMLU, MATH, GSM8K и HumanEval. Это разные группы измерений: первые проверяют работу с длинными последовательностями, вторые — ряд общих, математических и программных навыков. Их результаты нельзя свести к одной гарантии качества на всех документах или языках.

Как выбрать вариант UltraLong

Сравнение контрольных точек семейства

NVIDIA опубликовала три варианта UltraLong-8B: 1M, 2M и 4M. Варианты используют одну базовую модель и общий подход к обучению, но различаются предельной длиной обучающей последовательности и контекстным окном. Практический выбор следует связывать с реальным размером входных данных и ресурсами развёртывания, а не только с максимальным числом в названии.

Лицензия и ограничения

Условия некоммерческого использования

Модельные карточки указывают лицензию CC-BY-NC-4.0. Обозначение NC ограничивает коммерческое использование; организациям следует изучить полный текст лицензии и условия Meta для базовой модели до включения чекпойнта в коммерческий продукт. Доступность открытых весов не означает отсутствие лицензионных ограничений.

Связанные модели и разработчик

Серия NVIDIA Nemotron-UltraLong

NVIDIA Llama 3.1 Nemotron 8B UltraLong 1M Instruct · NVIDIA Llama 3.1 Nemotron 8B UltraLong 4M Instruct · Llama 3.1 8B Instruct · NVIDIA в Вики Futuretools

Публичный выпуск и первичные источники

Страница проекта и карточка весов

Страница NVIDIA ADLR датирует публикацию проекта 14 апреля 2025 года и перечисляет все три контрольные точки. Дата в каталоге относится к этой официальной публикации; история репозиториев Hugging Face содержит более ранние служебные коммиты и позднейшие обновления, поэтому не трактуется как отдельная дата публичного анонса. Идентификатор NVIDIA — `nvidia/Llama-3.1-Nemotron-8B-UltraLong-2M-Instruct`. Карточка указывает контекст до 2 млн токенов, базовую модель Llama 3.1 8B Instruct и лицензию CC-BY-NC-4.0. Проект NVIDIA: From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models. Карточка модели: Llama-3.1-Nemotron-8B-UltraLong-2M-Instruct.