NVIDIA Llama 3.1 Nemotron 8B UltraLong 4M Instruct
NVIDIA Llama 3.1 Nemotron 8B UltraLong 4M Instruct — вариант для контекста до 4 млн токенов.
Llama 3.1 Nemotron 8B UltraLong 4M Instruct — версия NVIDIA для контекстного окна до 4 млн токенов, наибольшего в серии Nemotron-UltraLong-8B. Она основана на Llama 3.1 8B Instruct и настроена для выполнения инструкций. По сравнению с близкими вариантами 1M и 2M здесь предусмотрена отдельная модельная контрольная точка и более длинная последовательность обучения; это не просто настройка лимита в интерфейсе.
- Назначение и длина контекста
- Для чего предназначена версия 4 млн токенов
- База модели и обучение
- Инструкционная настройка на Llama 3.1 8B
- Оценка длинного контекста
- Что измеряли в материалах NVIDIA
- Как выбрать вариант UltraLong
- Сравнение контрольных точек семейства
- Лицензия и ограничения
- Условия некоммерческого использования
- Связанные модели и разработчик
- Серия NVIDIA Nemotron-UltraLong
- Публичный выпуск и первичные источники
- Страница проекта и карточка весов
Назначение и длина контекста
Для чего предназначена версия 4 млн токенов
Контекстное окно до 4 млн токенов позволяет передать модели особенно большой объём текста в рамках одного обращения — при условии поддержки со стороны движка и достаточных ресурсов. Это полезно не для любой задачи: если в запросе нет необходимости удерживать столько исходного материала, более короткое окно может быть практичнее. Увеличение контекста повышает требования к памяти и вычислениям; точные требования зависят от конфигурации развёртывания.
База модели и обучение
Инструкционная настройка на Llama 3.1 8B
Карточка 4M описывает продолжение предварительного обучения на 1 млрд токенов с последовательностями длиной 4 млн токенов: 150 итераций и глобальный размер пакета 2. Затем проводилась инструкционная настройка на 1 млрд токенов в общих, математических и программных задачах. NVIDIA указывает, что для неё использовалась часть открытого набора general_sft_stage2 из проекта AceMath-Instruct.
Оценка длинного контекста
Что измеряли в материалах NVIDIA
NVIDIA проверяла серию на задачах длинного контекста RULER, LV-Eval и InfiniteBench, а также на общих и профильных тестах MMLU, MATH, GSM8K и HumanEval. В карточке заявлено сохранение конкурентных результатов на обычных тестах при оценке UltraLong на длинных последовательностях. Эти выводы относятся к опубликованной методике и не гарантируют одинаковый результат для произвольного корпуса, языка или способа запуска.
Как выбрать вариант UltraLong
Сравнение контрольных точек семейства
NVIDIA опубликовала три варианта UltraLong-8B: 1M, 2M и 4M. Варианты используют одну базовую модель и общий подход к обучению, но различаются предельной длиной обучающей последовательности и контекстным окном. Практический выбор следует связывать с реальным размером входных данных и ресурсами развёртывания, а не только с максимальным числом в названии.
Лицензия и ограничения
Условия некоммерческого использования
Модельные карточки указывают лицензию CC-BY-NC-4.0. Обозначение NC ограничивает коммерческое использование; организациям следует изучить полный текст лицензии и условия Meta для базовой модели до включения чекпойнта в коммерческий продукт. Доступность открытых весов не означает отсутствие лицензионных ограничений.
Связанные модели и разработчик
Серия NVIDIA Nemotron-UltraLong
NVIDIA Llama 3.1 Nemotron 8B UltraLong 1M Instruct · NVIDIA Llama 3.1 Nemotron 8B UltraLong 2M Instruct · Llama 3.1 8B Instruct · NVIDIA в Вики Futuretools
Публичный выпуск и первичные источники
Страница проекта и карточка весов
Страница NVIDIA ADLR датирует публикацию проекта 14 апреля 2025 года и перечисляет все три контрольные точки. Дата в каталоге относится к этой официальной публикации; история репозиториев Hugging Face содержит более ранние служебные коммиты и позднейшие обновления, поэтому не трактуется как отдельная дата публичного анонса. Идентификатор NVIDIA — `nvidia/Llama-3.1-Nemotron-8B-UltraLong-4M-Instruct`. Карточка указывает максимальное окно 4 млн токенов, базу Llama 3.1 8B Instruct и лицензию CC-BY-NC-4.0. Проект NVIDIA: From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models. Карточка модели: Llama-3.1-Nemotron-8B-UltraLong-4M-Instruct.