DeepSeek-R1-Zero

Экспериментальная модель рассуждений DeepSeek, обученная масштабным подкреплением без предварительной supervised-настройки.

DeepSeek-R1-Zero — экспериментальная модель рассуждений, опубликованная вместе с R1 20 января 2025 года. В технической статье компания описывает её обучение масштабным подкреплением без предварительного этапа supervised fine-tuning.

Рассуждения, возникающие при обучении с подкреплением

DeepSeek сообщает, что R1-Zero самостоятельно формировала поведение, связанное с проверкой промежуточных шагов и пересмотром решения. Модель демонстрировала заметные способности в математике и коде, но в статье также отмечены повторения, менее читаемые ответы и смешение языков.

Почему появилась DeepSeek-R1

Следующая модель R1 добавила холодный старт на размеченных примерах перед усиленным обучением. По объяснению авторов, этот подход помог сохранить рассуждения и сделать ответы более понятными и согласованными.

Модели одной публикации

Сравните базовую R1 и компактные варианты, обученные на её примерах: DeepSeek-R1 R1-Distill-Qwen-32B R1-Distill-Llama-70B DeepSeek-R1-0528

Другие выпуски DeepSeek собраны на странице разработчика в Вики Futuretools.ru.

Дата и сведения сверены с официальным источником DeepSeek. Дата взята из официального анонса R1; описание обучения и ограничений — из технической статьи DeepSeek.