Llama 3.1 Nemotron 70B Instruct
Llama 3.1 Nemotron 70B Instruct — диалоговая модель NVIDIA для выполнения инструкций, чата и агентных сценариев.
Llama 3.1 Nemotron 70B Instruct — модель NVIDIA для диалога и выполнения инструкций, которую компания представила в публикации от 3 октября 2024 года. NVIDIA обучила её с использованием собственной Reward-модели и предпочтений из HelpSteer2. Базой послужила Llama 3.1 70B; в статье разработчик отдельно отмечает лицензию Llama 3.1.
Диалог и следование запросам
Обучение с оценкой предпочтений
В отличие от Reward-варианта, который ранжирует ответы, Instruct-модель генерирует текст. NVIDIA использовала Llama 3.1 Nemotron 70B Reward для оценки вариантов и алгоритм REINFORCE при дополнительном обучении. Такой процесс был направлен на повышение полезности ответов в диалоге; он не означает, что модель безошибочна или подходит для любого предметного домена без проверки.
Опубликованные результаты
Оценки Arena Hard относятся к версии теста 2024 года
В официальной статье NVIDIA сообщала об оценке 85 на Arena Hard для тогдашней модели и сравнивала её с другими системами того периода. Разработчик также описывал результаты в задачах инструкции и чата. Эти показатели исторические и зависят от методики бенчмарка, поэтому их не следует сравнивать напрямую с более поздними рейтингами без проверки условий.
Связь с другими моделями
Reward-модель и эффективная версия 51B
Для оценки ответов NVIDIA выпускала Llama 3.1 Nemotron 70B Reward. Для более эффективной работы на одном GPU компания ранее представила Llama 3.1 Nemotron 51B Instruct; это отдельная модель с другой архитектурной оптимизацией.
Дата выпуска и первичный источник
Подтверждение NVIDIA
В публикации NVIDIA от 03.10.2024 сказано, что Llama 3.1 Nemotron 70B Instruct обучена с помощью Reward-модели, HelpSteer2-Preference Prompts и REINFORCE; указана Llama 3.1 License и доступ через NVIDIA API и Hugging Face. Официальный материал: NVIDIA.
Сведения о разработчике и его моделях: NVIDIA в Вики Futuretools.ru.