DeepSeek-R1
Открытая модель DeepSeek для сложных рассуждений, математики и программирования.
DeepSeek-R1 — модель DeepSeek для задач, где полезно последовательно разбирать условие и проверять несколько вариантов решения. Компания выпустила её 20 января 2025 года вместе с техническим отчётом и весами. В официальном анонсе DeepSeek сообщила о лицензии MIT и представила шесть компактных моделей, полученных дистилляцией R1 в семейства Qwen и Llama.
Рассуждение, математика и программирование
DeepSeek позиционировала R1 для сложных математических, логических и программных задач. Модель может тратить дополнительные вычисления на промежуточную проработку ответа, поэтому такие запросы обычно занимают больше времени, чем короткие справочные вопросы. В API режим рассуждения был доступен через отдельную модельную конечную точку; конкретный способ вызова зависит от текущих настроек и версий API.
Основная модель и компактные варианты
Оригинальная R1 требует крупной вычислительной инфраструктуры. Дистиллированные варианты на 1,5B, 7B, 8B, 14B, 32B и 70B рассчитаны на меньшие требования, но при переносе возможностей в компактную модель качество может измениться. Разработчик опубликовал их как отдельные веса, позволяющие запускать решения в собственной инфраструктуре и настраивать их под задачу.
Использование и ограничения
Открытая лицензия упрощает самостоятельное развёртывание, но не снимает требований к оценке качества, безопасности данных и проверке лицензий зависимостей. Не поручайте модели необратимые действия без проверки человеком. Позже DeepSeek выпустила обновлённую DeepSeek-R1-0528 и универсальную DeepSeek-V3, развивавшуюся в сторону совмещения рассуждения и вызова инструментов.
Сведения о разработчике и его моделях: DeepSeek в Вики Futuretools.ru.
Официальный источник: материал разработчика.