Llama 3.1 Nemotron 70B Reward

Llama 3.1 Nemotron 70B Reward оценивает ответы языковых моделей по человеческим предпочтениям и помогает отбирать данные для обучения.

Llama 3.1 Nemotron 70B Reward — модель оценки ответов, выпущенная NVIDIA 3 октября 2024 года. Она принимает запрос и ответ языковой модели и выставляет оценку, отражающую соответствие предпочтениям людей. Такие оценки можно использовать для отбора ответов и обучения других моделей, но сама Reward-версия не предназначена для обычного диалога с пользователем.

Модель для оценки качества ответов

Ранжирование вместо генерации текста пользователю

Reward-модель помогает сравнивать варианты ответа на один запрос и выбирать тот, который лучше соответствует заданным критериям. NVIDIA тестировала её на RewardBench, включающем диалог, сложные вопросы, безопасность и рассуждения. В статье 2024 года разработчик сообщал об общей оценке 94,1%; это опубликованный результат конкретного теста того периода, а не независимая гарантия качества в произвольном применении.

Обучающие данные и применение

HelpSteer2 и настройка Llama Nemotron Instruct

NVIDIA сообщала, что обучала модель на HelpSteer2 и сочетала регрессионную оценку с подходом Bradley–Terry. Оценки Reward-модели могут служить сигналом предпочтения при последующем обучении с подкреплением. На таком процессе NVIDIA обучила отдельную диалоговую модель Llama 3.1 Nemotron 70B Instruct.

Лицензия и способ доступа

Компонент конвейера RLHF

Эта модель предназначена прежде всего для разработчиков, которые настраивают или оценивают языковые системы. Для работы с ней NVIDIA предлагала API NIM и загрузку весов. Условия использования нужно проверять для конкретного репозитория и сервиса: лицензия Reward-модели и лицензия базовой Llama-модели не должны автоматически считаться одинаковыми.

Дата выпуска и первичный источник

Подтверждение NVIDIA

Публикация NVIDIA от 03.10.2024 описывает Llama 3.1 Nemotron 70B Reward, оценивание ответов, HelpSteer2, RewardBench и роль модели при обучении 70B Instruct. Указанная в публикации оценка RewardBench относится к измерениям на дату статьи. Официальный материал: NVIDIA.

Сведения о разработчике и его моделях: NVIDIA в Вики Futuretools.ru.