Pixtral 12B
Pixtral 12B — открытая мультимодальная модель Mistral AI с визуальным энкодером 400 млн параметров и контекстом 128 тысяч токенов.
Pixtral 12B — первая мультимодальная модель Mistral AI для одновременной работы с текстом и изображениями, представленная 17 сентября 2024 года. Её архитектура объединяет визуальный энкодер на 400 млн параметров и текстовый декодер на 12 млрд. Модель принимает изображения разных размеров, поддерживает несколько изображений в контексте 128K и распространялась под Apache 2.0.
Изображения вместе с текстом
Переменный размер и соотношение сторон
Pixtral преобразует изображение в последовательность визуальных токенов с учётом исходного разрешения и пропорций. Это позволяет анализировать документы, таблицы, диаграммы и фотографии без предварительного сведения всех изображений к одному фиксированному размеру. Модель может работать с несколькими изображениями в рамках длинного текстового контекста.
Состав архитектуры
Энкодер 400M и декодер 12B
Визуальная часть кодирует изображение, после чего мультимодальный декодер формирует текстовый ответ по сочетанию визуальных и текстовых данных. Mistral описывала Pixtral как модель, которая сохраняет текстовые возможности Mistral Nemo и добавляет понимание изображений. Указанные в анонсе тестовые баллы — оценка самой компании.
Следующие визуальные модели
Pixtral Large и Mistral Nemo
Базовый языковой компонент основан на Mistral Nemo 12B. В ноябре того же года вышла значительно более крупная Pixtral Large. В официальном анонсе Pixtral 12B теперь помечена как deprecated; она остаётся историческим этапом открытых визуальных моделей Mistral.
Дата выпуска и источник
Что подтверждают материалы разработчика
Анонс от 17.09.2024 подтверждает 400M vision encoder, 12B decoder, 128K, Apache 2.0 и поддержку изображений произвольного размера; модель позднее помечена как deprecated. Первичный источник: официальная публикация или карточка Mistral AI.
Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.