Mistral Embed
Mistral Embed — модель Mistral AI для преобразования текста в векторы и семантического поиска; размер embedding — 1 024 измерения.
Mistral Embed — модель эмбеддингов Mistral AI, появившаяся вместе с запуском платформы La Plateforme 11 декабря 2023 года. Она преобразует текстовые фрагменты в числовые векторы, которые можно индексировать для семантического поиска. Документация указывает контекст до 8 тысяч токенов, а анонс платформы — размер вектора 1 024 измерения.
Как работают эмбеддинги
Смысл текста представлен числовым вектором
Для поиска исходный материал и запрос преобразуются в векторы. Система сопоставляет их по близости, поэтому может находить документ по смыслу даже тогда, когда в нём нет точного совпадения с формулировкой пользователя. Mistral описывает модель как средство для построения таких представлений, а не как генератор готового ответа.
Подключение к поисковой системе
API, индексация и последующая выдача
Вызов модели выполняется через endpoint эмбеддингов. Разработчику приложения нужно самостоятельно разбить документы на фрагменты, сохранить векторы и связать их с оригинальными материалами. Размерность 1 024 задаёт ширину каждого вектора; лимит входа карточки модели составляет 8K токенов.
Место в линейке
Отдельно от генерации и кодовых моделей
Для генерации и дополнения кода Mistral позже развивала семейство Codestral, а для семантического поиска именно по коду представила Codestral Embed. Mistral Embed — самостоятельный текстовый embedding endpoint ранней платформы.
Дата выпуска и источник
Что подтверждают материалы разработчика
Карточка Mistral Docs датирует endpoint 11.12.2023 и указывает 8K контекста; в анонсе La Plateforme разработчик приводит вектор размерности 1 024. Первичный источник: официальная публикация или карточка Mistral AI.
Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.