Codestral Embed

Codestral Embed — модель Mistral AI, которая превращает фрагменты кода в векторы для семантического поиска и поиска по репозиторию.

Codestral Embed — первая специализированная модель Mistral AI для построения векторных представлений программного кода. Она вышла 28 мая 2025 года и предназначена для поиска релевантных фрагментов в репозиториях, а не для генерации кода как чат-модель.

Поиск по смыслу, а не только по словам

Кодовые фрагменты превращаются в embeddings

Модель сопоставляет запрос с кодовыми фрагментами по смысловой близости. Это помогает находить подходящую реализацию, когда формулировка запроса не совпадает с названиями функций или переменных в репозитории. В API доступны embeddings разных размерностей и точностей, что позволяет выбирать компромисс между качеством поиска и объёмом хранимого индекса.

Использование в инженерных системах

RAG, семантический поиск и обнаружение похожего кода

Mistral перечисляет поиск контекста для систем генерации кода, запросы на естественном языке, поиск похожих фрагментов и группировку кода. Такой слой обычно становится частью системы индексации: код делят на фрагменты, преобразуют в векторы, сохраняют и затем извлекают подходящие части. Сам Codestral Embed не выполняет генерацию и не заменяет поисковую инфраструктуру.

Связь с моделями кода

Embedding дополняет генератор и агента

Код может генерировать Codestral 25.08 или предшествующая Codestral 25.01; задачу изменения проекта можно передать Devstral 2. Codestral Embed выдаёт поисковое представление и используется как отдельный компонент перед генерацией.

Дата выпуска и источник

Первичная публикация разработчика

Дата 28.05.2025, назначение для поиска по коду и доступность через API подтверждены официальным анонсом Mistral. Источник: официальная публикация или документация Mistral AI.

Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.