DeepSeek-R1

Открытая модель DeepSeek для сложных рассуждений, математики и программирования.

DeepSeek-R1 — модель DeepSeek для задач, где полезно последовательно разбирать условие и проверять несколько вариантов решения. Компания выпустила её 20 января 2025 года вместе с техническим отчётом и весами. В официальном анонсе DeepSeek сообщила о лицензии MIT и представила шесть компактных моделей, полученных дистилляцией R1 в семейства Qwen и Llama.

Рассуждение, математика и программирование

DeepSeek позиционировала R1 для сложных математических, логических и программных задач. Модель может тратить дополнительные вычисления на промежуточную проработку ответа, поэтому такие запросы обычно занимают больше времени, чем короткие справочные вопросы. В API режим рассуждения был доступен через отдельную модельную конечную точку; конкретный способ вызова зависит от текущих настроек и версий API.

Основная модель и компактные варианты

Оригинальная R1 требует крупной вычислительной инфраструктуры. Дистиллированные варианты на 1,5B, 7B, 8B, 14B, 32B и 70B рассчитаны на меньшие требования, но при переносе возможностей в компактную модель качество может измениться. Разработчик опубликовал их как отдельные веса, позволяющие запускать решения в собственной инфраструктуре и настраивать их под задачу.

Использование и ограничения

Открытая лицензия упрощает самостоятельное развёртывание, но не снимает требований к оценке качества, безопасности данных и проверке лицензий зависимостей. Не поручайте модели необратимые действия без проверки человеком. Позже DeepSeek выпустила обновлённую DeepSeek-R1-0528 и универсальную DeepSeek-V3, развивавшуюся в сторону совмещения рассуждения и вызова инструментов.

Сведения о разработчике и его моделях: DeepSeek в Вики Futuretools.ru.

Официальный источник: материал разработчика.