DeepSeek-R1-Distill-Qwen-7B
Модель рассуждений на базе Qwen2.5-Math-7B, дообученная DeepSeek на примерах ответов R1.
DeepSeek-R1-Distill-Qwen-7B была опубликована 20 января 2025 года в составе открытого семейства R1-Distill. DeepSeek указывает Qwen2.5-Math-7B как базовую модель и обучение на образцах, созданных полной R1.
Баланс размера и рассуждений
Вариант на 7 млрд параметров предназначен для сценариев, где полный R1 слишком велик для доступной инфраструктуры. Открытые веса позволяют запускать модель самостоятельно; скорость и качество будут зависеть от аппаратной конфигурации и квантизации.
Происхождение и лицензия
Это дообученная модель на базе Qwen, а не уменьшенная копия весов R1. DeepSeek отмечает происхождение от серии Qwen2.5 и отдельные условия исходной модели; перед коммерческим использованием следует ознакомиться с лицензией соответствующих весов.
Соседние размеры
Другие модели Qwen-ветки позволяют выбрать более лёгкую или более ёмкую конфигурацию: Qwen-1.5B Qwen-14B Qwen-32B
Другие выпуски DeepSeek собраны на странице разработчика в Вики Futuretools.ru.
Дата и сведения сверены с официальным источником DeepSeek. Технические сведения и дата соответствуют официальному каталогу моделей DeepSeek-R1.
Предыдущая модель в этой линейке — DeepSeek-R1.