DeepSeek-R1-Zero
Экспериментальная модель рассуждений DeepSeek, обученная масштабным подкреплением без предварительной supervised-настройки.
DeepSeek-R1-Zero — экспериментальная модель рассуждений, опубликованная вместе с R1 20 января 2025 года. В технической статье компания описывает её обучение масштабным подкреплением без предварительного этапа supervised fine-tuning.
Рассуждения, возникающие при обучении с подкреплением
DeepSeek сообщает, что R1-Zero самостоятельно формировала поведение, связанное с проверкой промежуточных шагов и пересмотром решения. Модель демонстрировала заметные способности в математике и коде, но в статье также отмечены повторения, менее читаемые ответы и смешение языков.
Почему появилась DeepSeek-R1
Следующая модель R1 добавила холодный старт на размеченных примерах перед усиленным обучением. По объяснению авторов, этот подход помог сохранить рассуждения и сделать ответы более понятными и согласованными.
Модели одной публикации
Сравните базовую R1 и компактные варианты, обученные на её примерах: DeepSeek-R1 R1-Distill-Qwen-32B R1-Distill-Llama-70B DeepSeek-R1-0528
Другие выпуски DeepSeek собраны на странице разработчика в Вики Futuretools.ru.
Дата и сведения сверены с официальным источником DeepSeek. Дата взята из официального анонса R1; описание обучения и ограничений — из технической статьи DeepSeek.