Cosmos-Predict2.5
Cosmos-Predict2.5 объединяет генерацию по тексту, изображению и видео для моделирования будущих состояний физического мира.
Cosmos-Predict2.5 — семейство видеомоделей NVIDIA для симуляции физических сцен. Официальные репозиторий и карточки весов датируют выпуск 6 октября 2025 года. Версия 2.5 объединила генерацию Text2World, Image2World и Video2World в одной модели: разработчик может задать описание, начальное изображение или видеоконтекст и получить продолжение виртуального мира.
Единая модель для нескольких режимов
Текст, изображение или видео на входе
Предыдущие варианты Predict решали отдельные задачи генерации. Predict2.5 сводит три направления в одну архитектуру и поддерживает создание видео длиной до 30 секунд, согласно материалам NVIDIA. В зависимости от задачи модель может продолжать сцену, строить её по изображению или генерировать последовательность по текстовой подсказке.
Размеры и обучение
Версии на 2 и 14 млрд параметров
В официальной технической публикации описаны размеры 2B и 14B, обучение на 200 млн видеоклипов, а также этапы постобучения с объединением моделей и обучением с подкреплением. Указанный масштаб данных и оценки качества относятся к методике NVIDIA. Для практического запуска нужно сверяться с конкретной контрольной точкой и требованиями Cosmos.
Связь с семейством Cosmos
Predict вместе с Reason и Transfer
Predict2.5 отвечает за генерацию возможных состояний мира. Для переноса данных симуляции в реалистичное видео NVIDIA предлагает Cosmos-Transfer2.5, а физическое объяснение сцены — отдельная задача семейства Reason. Более ранний Predict1 описан на странице Cosmos-Predict1.
Связанные модели и разработчик
Карточки внутри экосистемы NVIDIA
Cosmos-Predict2 · Cosmos-Transfer2.5 · Cosmos-Reason2 · NVIDIA в Вики Futuretools
Дата выпуска и первичный источник
Официальные сведения
Официальная карточка NVIDIA указывает модели 2B и 14B, режимы Text2World/Image2World/Video2World и дату выпуска 06.10.2025; технический отчёт описывает обучение на 200 млн клипов. Первичный источник: NVIDIA.