DeepSeek-R1-Distill-Llama-70B
Крупная модель рассуждений на базе Llama 3.3 70B, дообученная на примерах DeepSeek-R1.
DeepSeek-R1-Distill-Llama-70B — вариант семейства R1-Distill, опубликованный 20 января 2025 года. В качестве основы DeepSeek указывает Llama 3.3-70B-Instruct и обучение на примерах, созданных R1.
Крупный вариант для самостоятельного размещения
Модель переносит поведение, связанное с рассуждениями, в архитектуру Llama с 70 млрд параметров. По размеру она существенно компактнее полной R1 на 671 млрд параметров, но для запуска всё ещё нужна подходящая вычислительная инфраструктура.
Базовая модель и условия распространения
Поскольку веса основаны на Llama 3.3, пользователь должен учитывать лицензионные условия Meta Llama. В публикации DeepSeek указана производная основа, а не единое разрешение, одинаковое для каждой модели R1-Distill.
Другие варианты R1
Сравните с исходной моделью рассуждений и плотными моделями меньшего размера: DeepSeek-R1 DeepSeek-R1-Zero Qwen-32B Llama-8B
Другие выпуски DeepSeek собраны на странице разработчика в Вики Futuretools.ru.
Дата и сведения сверены с официальным источником DeepSeek. Название, дата и база Llama 3.3-70B-Instruct указаны в официальном репозитории DeepSeek-R1.