EmbeddingGemma 2 — открытая модель Google для мультимодального поиска

EmbeddingGemma 2 превращает текст, код, изображения, видео и аудио в векторы для семантического поиска, классификации и RAG. Модель можно запускать локально.

EmbeddingGemma 2 — открытая модель Google DeepMind, которая превращает текст, программный код, изображения, видео и аудио в числовые векторы. Благодаря общему пространству представлений текстовый запрос можно использовать для поиска по фотографиям, видеокадрам или аудиозаписям. Модель рассчитана на локальный запуск на телефонах и компьютерах и не генерирует ответы как чат-бот: она помогает найти и сопоставить материалы, а дальнейшую обработку выполняет приложение.

EmbeddingGemma 2 представлена 6 октября 2026 года. Она построена на архитектуре Gemma 4, содержит 740 млн параметров вместе с дополнительными модулями и распространяется по лицензии Apache 2.0. Версии с текстовым, визуальным и аудиокодировщиками можно подключать отдельно, поэтому для текстового поиска не обязательно загружать всю мультимодальную модель.

Как модель помогает искать по смыслу

Один запрос — разные типы материалов

Обычный поиск часто требует совпадения слов. Векторный поиск сначала переводит запрос и материалы в наборы чисел — векторы, — а затем сравнивает, насколько близки их значения. EmbeddingGemma 2 обучена создавать такие представления для разных типов данных в одном пространстве. Поэтому запрос вроде «закат над морем» можно сопоставить не только с подписями к фотографиям, но и с самими изображениями или подходящими кадрами видео.

Модель также позволяет находить аудиозаписи по текстовому запросу, сравнивать изображение с описанием и объединять в одном поиске материалы разных форматов. Google приводит примеры локального поиска по личной медиатеке и нахождения нужного момента в видео. При обработке видео модель анализирует выбранные кадры, а не смотрит ролик как человек.

Поиск в документах, коде и базе знаний

Для текстовых документов и программного кода EmbeddingGemma 2 формирует представления, по которым приложение может находить тематически близкие фрагменты. Это подходит для семантического поиска по корпоративным материалам, индексации кода и подготовки контекста для системы RAG. В последнем случае модель помогает подобрать источники, а формулирует ответ отдельная генеративная модель, например Gemma 4.

В тесте MTEB Code, который Google приводит в карточке модели, показатель вырос с 68,76 у первой EmbeddingGemma до 78,68 у второй. Это результат конкретного бенчмарка, а не гарантия такой же точности на любом языке программирования или кодовой базе. Перед внедрением стоит проверить поиск на собственных файлах и запросах.

Чем EmbeddingGemma 2 отличается от первой версии

От текстовых векторов к общему мультимодальному пространству

Первая EmbeddingGemma была компактной моделью для текстовых представлений. Версия 2 добавляет обработку изображений, видео и аудио, сохраняя текст и код среди входных данных. Её выход — вектор длиной 768 измерений; для отдельных сценариев его можно сократить до 512, 256 или 128 измерений.

Контекст модели составляет до 8 192 токенов и общий для текста и медиа. При стандартных настройках в него помещается примерно до 29 изображений, до 58 видеокадров или около 5,5 минуты аудио, если использовать только один такой тип данных. Если объединить форматы или добавить текст, доступный объём для каждого из них уменьшится.

Размер модели и требования к устройству

Можно загружать только нужные модули

Полная модель содержит 740 млн параметров. Текстовая часть занимает 270 млн; модуль обработки изображений добавляет 170 млн, аудио — 300 млн. Поэтому можно начать с текстового поиска, подключить изображение или звук, когда они нужны, либо использовать полную конфигурацию. Число параметров не равно точному размеру файлов или требуемой оперативной памяти: фактическая нагрузка зависит от формата весов, квантования, библиотеки и устройства.

В качестве конкретного примера Google сообщает, что после квантования на Pixel 11 Pro активная память составляет около 191 МБ для текстового варианта и 567 МБ для полной мультимодальной конфигурации. Эти значения относятся к указанному телефону и настройкам, а не являются универсальными требованиями для всех устройств.

Сжатие векторов экономит место в поисковом индексе

Технология Matryoshka позволяет оставлять в представлении меньше измерений. Вектор можно сократить с 768 до 512, 256 или 128 значений. Это уменьшает объём хранения вектора и затраты на поиск в базе; при 128 измерениях экономия относительно полного вектора достигает шести раз. Чем короче вектор, тем сильнее может измениться качество сопоставления. Google отмечает близкие к исходным результаты для многих задач при 256 измерениях, а качество на 128 измерениях особенно важно проверять для мультимодальных сценариев.

Практические сценарии применения

  • семантический поиск по внутренним документам и базе знаний без точного совпадения формулировок;
  • поиск фотографий и видеокадров по текстовому описанию или примеру изображения;
  • поиск аудиозаписей по смыслу и сравнение звуковых фрагментов;
  • индексация репозиториев и поиск участков кода по запросу на обычном языке;
  • классификация, группировка похожих материалов и выявление дубликатов;
  • подготовка найденных фрагментов для RAG-системы с отдельной языковой моделью.

Что учесть при внедрении

Чтобы поиск работал предсказуемо, запросы и индексируемые материалы нужно обрабатывать совместимыми настройками. Для поиска Google рекомендует разные инструкции для запроса и документа; после сокращения вектора необходимо также корректно нормализовать его. Если менять модель или размерность, существующий индекс обычно приходится пересоздать, а качество — сравнить на примерах из рабочего сценария.

Запуск на устройстве может сократить передачу исходных файлов в облако, но сам по себе не гарантирует конфиденциальность. Приложение всё ещё отвечает за хранение векторов, права доступа, резервное копирование и отправку данных другим сервисам. Поддержка более чем 100 языков также не означает одинаковой точности для каждого языка: качество русского поиска следует проверить на своих материалах.

Лицензия и доступ к модели

Открытые веса для локального использования

EmbeddingGemma 2 опубликована под Apache 2.0; веса доступны в репозитории Google на Hugging Face, а исходный код и руководства — в официальных материалах Gemma. Для загрузки используйте точное имя модели google/embeddinggemma-2. Потребуются совместимая среда выполнения и аппаратные ресурсы, соответствующие выбранным модулям.

EmbeddingGemma 2 не следует путать с Gemini Embedding 2: это отдельная мультимодальная модель, доступная через облачный Gemini API. EmbeddingGemma 2 предназначена для работы с открытыми весами и самостоятельного размещения; другие модели семейства собраны на странице Google DeepMind в Вики.