VideoTemp-o3
VideoTemp-o3 — исследовательская модель Kuaishou для поиска нужного временного фрагмента и ответов на вопросы по видео.
Команда Kwai Keye открыла веса, обучающие данные и тестовый набор VideoTemp-o3 18 мая 2026 года. Модель предназначена для вопросов по видео, где ответ требует найти конкретный эпизод, а не только обобщить весь ролик.
Поиск ответа во временной последовательности
VideoTemp-o3 определяет отрезок, относящийся к вопросу, и уточняет его поэтапно. Такая связка временной локализации и понимания видео помогает обосновывать ответ визуальными свидетельствами из нужного момента. В репозитории проект назван агентным подходом к рассуждению по видео.
Открытая исследовательская модель
Модель содержит 8 млрд параметров и дообучена на Qwen2.5-VL-7B-Instruct. Команда ранее опубликовала статью и код: статья размещена 8 февраля, код обучения и оценки — 6 марта, а веса и данные стали доступны 18 мая 2026 года. Лицензия модели на Hugging Face — MIT.
Чем отличается от Keye-VL
VideoTemp-o3 фокусируется на вопросах и точной временной привязке в видео, а Keye-VL охватывает более широкий набор визуально-языковых сценариев. Сравните Keye-VL 2.0 30B A3B Keye-VL 1.5 8B Kling Video 3.0
Статус и границы применения
Это опубликованный исследовательский проект с весами, данными и бенчмарком, а не готовая пользовательская подписка или хостинговый API. Для самостоятельного запуска требуются совместимое ПО и ускоритель; пригодность для реальных потоков видео необходимо оценить отдельным испытанием.
Разработчик и первичный источник
Другие модели Kuaishou собраны в странице разработчика в Вики Futuretools.ru.
Название, дата и характеристики сверены с официальным материалом Kuaishou или команды модели.