DeepSeek-R1-Distill-Llama-70B

Крупная модель рассуждений на базе Llama 3.3 70B, дообученная на примерах DeepSeek-R1.

DeepSeek-R1-Distill-Llama-70B — вариант семейства R1-Distill, опубликованный 20 января 2025 года. В качестве основы DeepSeek указывает Llama 3.3-70B-Instruct и обучение на примерах, созданных R1.

Крупный вариант для самостоятельного размещения

Модель переносит поведение, связанное с рассуждениями, в архитектуру Llama с 70 млрд параметров. По размеру она существенно компактнее полной R1 на 671 млрд параметров, но для запуска всё ещё нужна подходящая вычислительная инфраструктура.

Базовая модель и условия распространения

Поскольку веса основаны на Llama 3.3, пользователь должен учитывать лицензионные условия Meta Llama. В публикации DeepSeek указана производная основа, а не единое разрешение, одинаковое для каждой модели R1-Distill.

Другие варианты R1

Сравните с исходной моделью рассуждений и плотными моделями меньшего размера: DeepSeek-R1 DeepSeek-R1-Zero Qwen-32B Llama-8B

Другие выпуски DeepSeek собраны на странице разработчика в Вики Futuretools.ru.

Дата и сведения сверены с официальным источником DeepSeek. Название, дата и база Llama 3.3-70B-Instruct указаны в официальном репозитории DeepSeek-R1.