Command A Vision

Мультимодальная модель Cohere для анализа документов, таблиц, графиков и изображений с текстом.

Command A Vision — первая коммерческая модель Cohere в семействе Command, которая принимает не только текст, но и изображения. О её выпуске компания сообщила 31 июля 2025 года. Основные корпоративные задачи — чтение документов, распознавание текста, анализ таблиц и графиков.

Какие визуальные данные обрабатывает модель

Один запрос может содержать до 20 изображений; в документации указано окно контекста 128 тысяч токенов и максимальный ответ до 8 тысяч. Cohere называет официально поддерживаемыми английский, португальский, итальянский, французский, немецкий и испанский. Эти ограничения относятся к версии command-a-vision-07-2025.

Для документов и визуальных вопросов

Модель может отвечать на вопросы по изображению, извлекать сведения из таблиц и диаграмм и выполнять OCR с последующей обработкой текста. Для критичных документов результаты нужно сверять с оригиналом: распознавание изображения не гарантирует точное извлечение каждого значения.

В линейке Cohere

Command A Vision дополняет базовую языковую Command A. Позднее появились Command A Reasoning, Command A Translate и объединяющая функции Command A+. См. карточки Command A; Command A Reasoning; Command A Translate; Command A+

Разработчик и первичный источник

Другие модели компании собраны в разделе «Cohere» в Вики Futuretools.ru.

Дата и характеристики сверены с официальным материалом разработчика.