Voxtral Small

Voxtral Small — открытая аудиомультимодальная модель Mistral AI на 24 млрд параметров для транскрибации и понимания речи.

Voxtral Small — первая крупная модель Mistral AI для понимания аудио, выпущенная 15 июля 2025 года. Она содержит 24 млрд параметров, принимает аудио и текст, имеет контекст 32 тысячи токенов и распространяется под Apache 2.0. Модель рассчитана на приложения, где важны качество распознавания и анализ речи.

Речь как вход для модели

Транскрибация и понимание содержания аудио

Voxtral Small выходит за пределы простого преобразования записи в текст: она сохраняет языковые возможности базовой модели и может работать с запросами о содержании аудио. Mistral указывает обработку записей до 30 минут для транскрибации и до 40 минут для понимания. Конкретный результат зависит от качества записи и задачи.

Размер и открытые веса

24B и лицензия Apache 2.0

Крупная версия предназначалась для производственных задач и опубликована с открытыми весами. Mistral сравнивала её результаты на тестах транскрибации и сообщала о сильных показателях относительно других систем; эти сравнения являются оценками разработчика. Веса можно использовать в совместимом окружении, соблюдая условия лицензии и требования оборудования.

Другие варианты Voxtral

Mini для локального запуска и отдельная Transcribe

Более компактный вариант — Voxtral Mini на 3 млрд параметров. Для API-транскрибации выпущена отдельная Voxtral Mini Transcribe. Следующее поколение включило Mini Transcribe V2 и потоковую Voxtral Realtime.

Дата выпуска и источник

Первичная публикация разработчика

Официальная публикация датирована 15.07.2025 и указывает 24B, 32K, Apache 2.0 и длительность аудио до 30 минут для транскрибации и 40 минут для понимания. Источник: официальная публикация или документация Mistral AI.

Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.