NVIDIA Llama 3.1 Nemotron 8B UltraLong 1M Instruct
NVIDIA Llama 3.1 Nemotron 8B UltraLong 1M Instruct — модель на базе Llama 3.1 с контекстом до 1 млн токенов.
Llama 3.1 Nemotron 8B UltraLong 1M Instruct — инструкционная языковая модель NVIDIA на базе Llama 3.1 8B Instruct. Её отличительный параметр — контекстное окно до 1 млн токенов. Модель входит в серию UltraLong, где NVIDIA выпустила три версии с окнами в 1, 2 и 4 млн токенов. Это вариант для задач, в которых системе нужно учитывать существенно больший объём текста, чем помещается в обычный короткий запрос.
- Назначение и длина контекста
- Для чего предназначена версия 1 млн токенов
- База модели и обучение
- Инструкционная настройка на Llama 3.1 8B
- Оценка длинного контекста
- Что измеряли в материалах NVIDIA
- Как выбрать вариант UltraLong
- Сравнение контрольных точек семейства
- Лицензия и ограничения
- Условия некоммерческого использования
- Связанные модели и разработчик
- Серия NVIDIA Nemotron-UltraLong
- Публичный выпуск и первичные источники
- Страница проекта и карточка весов
Назначение и длина контекста
Для чего предназначена версия 1 млн токенов
Версия 1M имеет наименьшее заявленное окно в семействе, но это не означает, что её запуск не требует значительных ресурсов. Фактическое потребление памяти и задержка зависят от длины входа, точности весов, числа одновременных запросов и программного движка. Максимальная длина — верхняя граница контекста модели, а не рекомендация всегда передавать миллион токенов.
База модели и обучение
Инструкционная настройка на Llama 3.1 8B
Для версии 1M NVIDIA указывает продолжение предварительного обучения на корпусе объёмом 1 млрд токенов: последовательности длиной 1 млн токенов, 125 итераций и глобальный размер пакета 8. Затем модель прошла инструкционную настройку ещё на 1 млрд токенов из открытых наборов для общих, математических и программных задач. В карточке NVIDIA сказано, что часть данных взята из набора general_sft_stage2 проекта AceMath-Instruct.
Оценка длинного контекста
Что измеряли в материалах NVIDIA
NVIDIA описывает оценку на тестах длинного контекста RULER, LV-Eval и InfiniteBench, а также на стандартных наборах MMLU, MATH, GSM8K и HumanEval. Производитель сообщает о конкурентных результатах на общих тестах и сильных результатах на длинном контексте; конкретный результат зависит от тестового набора и конфигурации. Само число 1M не доказывает, что любая информация будет извлечена безошибочно из любого объёма текста.
Как выбрать вариант UltraLong
Сравнение контрольных точек семейства
NVIDIA опубликовала три варианта UltraLong-8B: 1M, 2M и 4M. Варианты используют одну базовую модель и общий подход к обучению, но различаются предельной длиной обучающей последовательности и контекстным окном. Практический выбор следует связывать с реальным размером входных данных и ресурсами развёртывания, а не только с максимальным числом в названии.
Лицензия и ограничения
Условия некоммерческого использования
Модельные карточки указывают лицензию CC-BY-NC-4.0. Обозначение NC ограничивает коммерческое использование; организациям следует изучить полный текст лицензии и условия Meta для базовой модели до включения чекпойнта в коммерческий продукт. Доступность открытых весов не означает отсутствие лицензионных ограничений.
Связанные модели и разработчик
Серия NVIDIA Nemotron-UltraLong
NVIDIA Llama 3.1 Nemotron 8B UltraLong 2M Instruct · NVIDIA Llama 3.1 Nemotron 8B UltraLong 4M Instruct · Llama 3.1 8B Instruct · NVIDIA в Вики Futuretools
Публичный выпуск и первичные источники
Страница проекта и карточка весов
Страница NVIDIA ADLR датирует публикацию проекта 14 апреля 2025 года и перечисляет все три контрольные точки. Дата в каталоге относится к этой официальной публикации; история репозиториев Hugging Face содержит более ранние служебные коммиты и позднейшие обновления, поэтому не трактуется как отдельная дата публичного анонса. Идентификатор контрольной точки NVIDIA — `nvidia/Llama-3.1-Nemotron-8B-UltraLong-1M-Instruct`. В карточке указано максимальное окно 1 млн токенов, база Llama 3.1 8B Instruct и лицензия CC-BY-NC-4.0. Проект NVIDIA: From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models. Карточка модели: Llama-3.1-Nemotron-8B-UltraLong-1M-Instruct.