Kwai Keye-VL 8B Preview

Kwai Keye-VL — открытая мультимодальная модель на 8 млрд параметров для анализа коротких видео, изображений и вопросов по ним.

Команда Kwai Keye объявила о выпуске Keye-VL 26 июня 2025 года. Модель с 8 млрд параметров предназначена прежде всего для понимания коротких видео, а также решает задачи анализа изображений и ответов на визуальные вопросы.

Анализ коротких видео и изображений

В официальной карточке разработчики описывают Keye-VL как мультимодальную модель, которая сопоставляет текст с визуальными данными и рассуждает по содержанию видео. Для проверки модели команда выпустила KC-MMBench — тестовый набор для сценариев понимания коротких роликов.

Данные и обучение

В техническом описании указано более 600 млрд обучающих токенов с акцентом на видео, четырёхэтапное предварительное обучение и двухэтапная настройка после него. Исходные веса опубликованы в репозитории команды на Hugging Face по лицензии Apache 2.0.

Следующие версии Keye-VL

За исходной моделью последовали 1.5, крупная версия 671B и выпуск 2.0. Смотрите Keye-VL 1.5 8B Keye-VL 671B A37B Keye-VL 2.0 30B A3B

Для каких задач выпущена модель

Команда Keye ориентировала эту версию на понимание коротких видеороликов и визуальные вопросы. В базовой карточке HF название репозитория заканчивается на Preview; это обозначение сохраняется в каталоге, чтобы не выдавать экспериментальную сборку за коммерческий сервис Kuaishou.

Разработчик и первичный источник

Другие модели Kuaishou собраны в странице разработчика в Вики Futuretools.ru.

Название, дата и характеристики сверены с официальным материалом Kuaishou или команды модели.