Mistral 7B 0.1

Mistral 7B 0.1 — первая открытая модель Mistral AI на 7,3 млрд параметров с Apache 2.0, механизмами GQA и Sliding Window Attention.

Mistral 7B 0.1 — первая опубликованная языковая модель Mistral AI. Компания объявила её 27 сентября 2023 года и выпустила веса под Apache 2.0. В официальном анонсе указаны 7,3 млрд параметров, групповое внимание GQA и Sliding Window Attention — механизм, который ограничивает объём контекста, обрабатываемого каждым слоем.

Как устроена первая версия

Открытые веса и экономия вычислений

GQA сокращает объём памяти, необходимый для хранения ключей и значений внимания. Sliding Window Attention ограничивает локальный участок текста, на который модель смотрит при генерации. Вместе эти решения помогли сделать модель такого размера пригодной для запуска на доступном оборудовании. В стартовой карточке документации для v0.1 указан контекст 8 тысяч токенов.

Что умела модель

Общая генерация текста и отдельная Instruct-версия

Mistral представила базовые веса и инструкционно настроенный вариант для диалога. Разработчик показал, что модель можно дообучать под конкретную задачу; приведённые в публикации сравнения с другими системами были внутренними оценками команды. Веса не включали встроенную модерацию ответов, поэтому защитные правила требовалось реализовывать отдельно.

Дальнейшее развитие Mistral 7B

Увеличение контекста и новая версия токенизатора

В декабре появилась Mistral 7B 0.2 с контекстом 32K, а в мае 2024 года — версия 0.3 с расширенным словарём токенизатора. Позднее для компактных сценариев Mistral выпустила Ministral 3B и Ministral 8B.

Дата выпуска и источник

Что подтверждают материалы разработчика

Официальный анонс от 27.09.2023 сообщает о модели 7,3B, Apache 2.0, GQA и Sliding Window Attention; карточка Mistral Docs фиксирует контекст v0.1 в 8K и завершение жизненного цикла API в марте 2025 года. Первичный источник: официальная публикация или карточка Mistral AI.

Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.