Kwai Keye-VL 8B Preview
Kwai Keye-VL — открытая мультимодальная модель на 8 млрд параметров для анализа коротких видео, изображений и вопросов по ним.
Команда Kwai Keye объявила о выпуске Keye-VL 26 июня 2025 года. Модель с 8 млрд параметров предназначена прежде всего для понимания коротких видео, а также решает задачи анализа изображений и ответов на визуальные вопросы.
Анализ коротких видео и изображений
В официальной карточке разработчики описывают Keye-VL как мультимодальную модель, которая сопоставляет текст с визуальными данными и рассуждает по содержанию видео. Для проверки модели команда выпустила KC-MMBench — тестовый набор для сценариев понимания коротких роликов.
Данные и обучение
В техническом описании указано более 600 млрд обучающих токенов с акцентом на видео, четырёхэтапное предварительное обучение и двухэтапная настройка после него. Исходные веса опубликованы в репозитории команды на Hugging Face по лицензии Apache 2.0.
Следующие версии Keye-VL
За исходной моделью последовали 1.5, крупная версия 671B и выпуск 2.0. Смотрите Keye-VL 1.5 8B Keye-VL 671B A37B Keye-VL 2.0 30B A3B
Для каких задач выпущена модель
Команда Keye ориентировала эту версию на понимание коротких видеороликов и визуальные вопросы. В базовой карточке HF название репозитория заканчивается на Preview; это обозначение сохраняется в каталоге, чтобы не выдавать экспериментальную сборку за коммерческий сервис Kuaishou.
Разработчик и первичный источник
Другие модели Kuaishou собраны в странице разработчика в Вики Futuretools.ru.
Название, дата и характеристики сверены с официальным материалом Kuaishou или команды модели.