Llama 3.1 Nemotron 70B Instruct

Llama 3.1 Nemotron 70B Instruct — диалоговая модель NVIDIA для выполнения инструкций, чата и агентных сценариев.

Llama 3.1 Nemotron 70B Instruct — модель NVIDIA для диалога и выполнения инструкций, которую компания представила в публикации от 3 октября 2024 года. NVIDIA обучила её с использованием собственной Reward-модели и предпочтений из HelpSteer2. Базой послужила Llama 3.1 70B; в статье разработчик отдельно отмечает лицензию Llama 3.1.

Диалог и следование запросам

Обучение с оценкой предпочтений

В отличие от Reward-варианта, который ранжирует ответы, Instruct-модель генерирует текст. NVIDIA использовала Llama 3.1 Nemotron 70B Reward для оценки вариантов и алгоритм REINFORCE при дополнительном обучении. Такой процесс был направлен на повышение полезности ответов в диалоге; он не означает, что модель безошибочна или подходит для любого предметного домена без проверки.

Опубликованные результаты

Оценки Arena Hard относятся к версии теста 2024 года

В официальной статье NVIDIA сообщала об оценке 85 на Arena Hard для тогдашней модели и сравнивала её с другими системами того периода. Разработчик также описывал результаты в задачах инструкции и чата. Эти показатели исторические и зависят от методики бенчмарка, поэтому их не следует сравнивать напрямую с более поздними рейтингами без проверки условий.

Связь с другими моделями

Reward-модель и эффективная версия 51B

Для оценки ответов NVIDIA выпускала Llama 3.1 Nemotron 70B Reward. Для более эффективной работы на одном GPU компания ранее представила Llama 3.1 Nemotron 51B Instruct; это отдельная модель с другой архитектурной оптимизацией.

Дата выпуска и первичный источник

Подтверждение NVIDIA

В публикации NVIDIA от 03.10.2024 сказано, что Llama 3.1 Nemotron 70B Instruct обучена с помощью Reward-модели, HelpSteer2-Preference Prompts и REINFORCE; указана Llama 3.1 License и доступ через NVIDIA API и Hugging Face. Официальный материал: NVIDIA.

Сведения о разработчике и его моделях: NVIDIA в Вики Futuretools.ru.