Mistral Embed

Mistral Embed — модель Mistral AI для преобразования текста в векторы и семантического поиска; размер embedding — 1 024 измерения.

Mistral Embed — модель эмбеддингов Mistral AI, появившаяся вместе с запуском платформы La Plateforme 11 декабря 2023 года. Она преобразует текстовые фрагменты в числовые векторы, которые можно индексировать для семантического поиска. Документация указывает контекст до 8 тысяч токенов, а анонс платформы — размер вектора 1 024 измерения.

Как работают эмбеддинги

Смысл текста представлен числовым вектором

Для поиска исходный материал и запрос преобразуются в векторы. Система сопоставляет их по близости, поэтому может находить документ по смыслу даже тогда, когда в нём нет точного совпадения с формулировкой пользователя. Mistral описывает модель как средство для построения таких представлений, а не как генератор готового ответа.

Подключение к поисковой системе

API, индексация и последующая выдача

Вызов модели выполняется через endpoint эмбеддингов. Разработчику приложения нужно самостоятельно разбить документы на фрагменты, сохранить векторы и связать их с оригинальными материалами. Размерность 1 024 задаёт ширину каждого вектора; лимит входа карточки модели составляет 8K токенов.

Место в линейке

Отдельно от генерации и кодовых моделей

Для генерации и дополнения кода Mistral позже развивала семейство Codestral, а для семантического поиска именно по коду представила Codestral Embed. Mistral Embed — самостоятельный текстовый embedding endpoint ранней платформы.

Дата выпуска и источник

Что подтверждают материалы разработчика

Карточка Mistral Docs датирует endpoint 11.12.2023 и указывает 8K контекста; в анонсе La Plateforme разработчик приводит вектор размерности 1 024. Первичный источник: официальная публикация или карточка Mistral AI.

Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.