Mixtral 8x7B

Mixtral 8x7B — открытая модель Mistral AI на архитектуре смеси экспертов: 47 млрд параметров, из которых активно около 13 млрд.

Mixtral 8x7B — первая открытая модель Mistral AI на архитектуре разреженной смеси экспертов, представленная 11 декабря 2023 года. При полном размере около 47 млрд параметров для обработки одного токена активны примерно 13 млрд. Веса опубликованы под Apache 2.0; контекстная карточка указывает 32 тысячи токенов.

Смесь экспертов

Не все параметры включаются на каждом шаге

Архитектура MoE направляет токен к ограниченному числу экспертных блоков. Поэтому число активных параметров меньше общего числа параметров модели. Такой подход меняет баланс вычислительной нагрузки, но запуск всё равно требует памяти под общие веса и подходящей системы инференса.

Текстовые возможности

Многоязычная генерация и вариант Instruct

Mistral описывала поддержку английского, французского, итальянского, немецкого и испанского языков, а также сильные результаты в генерации кода. Одновременно с базовой моделью вышел Instruct-вариант, дообученный для выполнения запросов. Внутренние сравнения с другими моделями в анонсе являются оценкой разработчика, а не независимым тестированием.

Следующая крупная MoE-модель

Mixtral 8x22B

В апреле 2024 года Mistral выпустила Mixtral 8x22B с 141 млрд общих и 39 млрд активных параметров и окном 64K. Для общих задач компания позднее обновила линейку в моделях Mistral Large 3 и Mistral Small 4.

Дата выпуска и источник

Что подтверждают материалы разработчика

Анонс от 11.12.2023 сообщает о разреженной архитектуре MoE, Apache 2.0 и Instruct-варианте; официальная карточка указывает 47B/13B и контекст 32K. API-версия retired 30.03.2025. Первичный источник: официальная публикация или карточка Mistral AI.

Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.