NVIDIA Llama 3.1 Nemotron 8B UltraLong 4M Instruct

NVIDIA Llama 3.1 Nemotron 8B UltraLong 4M Instruct — вариант для контекста до 4 млн токенов.

Llama 3.1 Nemotron 8B UltraLong 4M Instruct — версия NVIDIA для контекстного окна до 4 млн токенов, наибольшего в серии Nemotron-UltraLong-8B. Она основана на Llama 3.1 8B Instruct и настроена для выполнения инструкций. По сравнению с близкими вариантами 1M и 2M здесь предусмотрена отдельная модельная контрольная точка и более длинная последовательность обучения; это не просто настройка лимита в интерфейсе.

Назначение и длина контекста

Для чего предназначена версия 4 млн токенов

Контекстное окно до 4 млн токенов позволяет передать модели особенно большой объём текста в рамках одного обращения — при условии поддержки со стороны движка и достаточных ресурсов. Это полезно не для любой задачи: если в запросе нет необходимости удерживать столько исходного материала, более короткое окно может быть практичнее. Увеличение контекста повышает требования к памяти и вычислениям; точные требования зависят от конфигурации развёртывания.

База модели и обучение

Инструкционная настройка на Llama 3.1 8B

Карточка 4M описывает продолжение предварительного обучения на 1 млрд токенов с последовательностями длиной 4 млн токенов: 150 итераций и глобальный размер пакета 2. Затем проводилась инструкционная настройка на 1 млрд токенов в общих, математических и программных задачах. NVIDIA указывает, что для неё использовалась часть открытого набора general_sft_stage2 из проекта AceMath-Instruct.

Оценка длинного контекста

Что измеряли в материалах NVIDIA

NVIDIA проверяла серию на задачах длинного контекста RULER, LV-Eval и InfiniteBench, а также на общих и профильных тестах MMLU, MATH, GSM8K и HumanEval. В карточке заявлено сохранение конкурентных результатов на обычных тестах при оценке UltraLong на длинных последовательностях. Эти выводы относятся к опубликованной методике и не гарантируют одинаковый результат для произвольного корпуса, языка или способа запуска.

Как выбрать вариант UltraLong

Сравнение контрольных точек семейства

NVIDIA опубликовала три варианта UltraLong-8B: 1M, 2M и 4M. Варианты используют одну базовую модель и общий подход к обучению, но различаются предельной длиной обучающей последовательности и контекстным окном. Практический выбор следует связывать с реальным размером входных данных и ресурсами развёртывания, а не только с максимальным числом в названии.

Лицензия и ограничения

Условия некоммерческого использования

Модельные карточки указывают лицензию CC-BY-NC-4.0. Обозначение NC ограничивает коммерческое использование; организациям следует изучить полный текст лицензии и условия Meta для базовой модели до включения чекпойнта в коммерческий продукт. Доступность открытых весов не означает отсутствие лицензионных ограничений.

Связанные модели и разработчик

Серия NVIDIA Nemotron-UltraLong

NVIDIA Llama 3.1 Nemotron 8B UltraLong 1M Instruct · NVIDIA Llama 3.1 Nemotron 8B UltraLong 2M Instruct · Llama 3.1 8B Instruct · NVIDIA в Вики Futuretools

Публичный выпуск и первичные источники

Страница проекта и карточка весов

Страница NVIDIA ADLR датирует публикацию проекта 14 апреля 2025 года и перечисляет все три контрольные точки. Дата в каталоге относится к этой официальной публикации; история репозиториев Hugging Face содержит более ранние служебные коммиты и позднейшие обновления, поэтому не трактуется как отдельная дата публичного анонса. Идентификатор NVIDIA — `nvidia/Llama-3.1-Nemotron-8B-UltraLong-4M-Instruct`. Карточка указывает максимальное окно 4 млн токенов, базу Llama 3.1 8B Instruct и лицензию CC-BY-NC-4.0. Проект NVIDIA: From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models. Карточка модели: Llama-3.1-Nemotron-8B-UltraLong-4M-Instruct.