DeepSeek-V2
DeepSeek-V2 — языковая модель с открытыми весами на архитектуре смеси экспертов и контекстом до 128 тысяч токенов.
DeepSeek выпустила DeepSeek-V2 6 мая 2024 года. В официальном репозитории модель описана как смесь экспертов общей ёмкостью 236 млрд параметров, из которых для обработки одного токена активны около 21 млрд.
Большая ёмкость при выборочной активации
Архитектура MoE направляет запрос лишь к части экспертов, а не использует все параметры одновременно. DeepSeek также описывает собственные механизмы внимания и контекста; для базовой модели указан предел 128 тысяч токенов. Все параметры и оценки в этой статье относятся к материалам самой DeepSeek.
Базовая и диалоговая версии
В репозитории опубликованы DeepSeek-V2 и DeepSeek-V2-Chat. В той же линейке появилась облегчённая версия V2-Lite с меньшим числом параметров и контекстом 32 тысячи токенов.
Обновления серии V2
Позднее API получил версии с отметками 0517 и 0628, а затем компания объединила общую и кодовую линейки в V2.5. Сравните DeepSeek-V2-Lite DeepSeek-V2-0517 DeepSeek-V2-Chat-0628 DeepSeek-V2.5
Другие выпуски DeepSeek собраны на странице разработчика в Вики Futuretools.ru.
Дата и сведения сверены с официальным источником DeepSeek. Дата 06.05.2024 указана в официальном репозитории DeepSeek-V2; параметры приведены по таблице модели.