Voxtral Small
Voxtral Small — открытая аудиомультимодальная модель Mistral AI на 24 млрд параметров для транскрибации и понимания речи.
Voxtral Small — первая крупная модель Mistral AI для понимания аудио, выпущенная 15 июля 2025 года. Она содержит 24 млрд параметров, принимает аудио и текст, имеет контекст 32 тысячи токенов и распространяется под Apache 2.0. Модель рассчитана на приложения, где важны качество распознавания и анализ речи.
Речь как вход для модели
Транскрибация и понимание содержания аудио
Voxtral Small выходит за пределы простого преобразования записи в текст: она сохраняет языковые возможности базовой модели и может работать с запросами о содержании аудио. Mistral указывает обработку записей до 30 минут для транскрибации и до 40 минут для понимания. Конкретный результат зависит от качества записи и задачи.
Размер и открытые веса
24B и лицензия Apache 2.0
Крупная версия предназначалась для производственных задач и опубликована с открытыми весами. Mistral сравнивала её результаты на тестах транскрибации и сообщала о сильных показателях относительно других систем; эти сравнения являются оценками разработчика. Веса можно использовать в совместимом окружении, соблюдая условия лицензии и требования оборудования.
Другие варианты Voxtral
Mini для локального запуска и отдельная Transcribe
Более компактный вариант — Voxtral Mini на 3 млрд параметров. Для API-транскрибации выпущена отдельная Voxtral Mini Transcribe. Следующее поколение включило Mini Transcribe V2 и потоковую Voxtral Realtime.
Дата выпуска и источник
Первичная публикация разработчика
Официальная публикация датирована 15.07.2025 и указывает 24B, 32K, Apache 2.0 и длительность аудио до 30 минут для транскрибации и 40 минут для понимания. Источник: официальная публикация или документация Mistral AI.
Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.