text-embedding-3-small

text-embedding-3-small — компактная модель OpenAI, которая преобразует текст или код в векторы для поиска, группировки и извлечения связанных материалов.

OpenAI представила text-embedding-3-small 25 января 2024 года. Модель преобразует текст или код в числовое представление — вектор, по которому система может искать смысловую близость между материалами. Эмбеддинги используют в поиске по базе знаний, группировке документов и подборе контекста для генеративных приложений.

Для чего нужны векторы

Смысловой поиск и работа с корпусом данных

Векторное представление помогает находить близкие по смыслу тексты даже при несовпадении ключевых слов. Это применяется в поиске по документам, рекомендациях, кластеризации и системах с извлечением контекста. text-embedding-3-small сама не пишет ответы и не является чат-моделью: она возвращает вектор, который затем сравнивает приложение или векторное хранилище.

Размерность и стоимость

Баланс качества и ресурсов

В анонсе OpenAI text-embedding-3-small описана как более компактная и эффективная модель относительно предыдущего поколения. Для сравнения, компания сообщила о среднем результате 44,0% против 31,4% у ada-002 в своём тесте многоязычного поиска MIRACL и о снижении цены API на 80%. Это результаты внутреннего сравнения OpenAI на указанных наборах данных, а не гарантия такого же прироста на каждом корпусе.

Настройка под хранилище

Можно сократить длину вектора

Семейство text-embedding-3 поддерживает параметр dimensions, который позволяет получить векторы меньшей длины. Уменьшение размерности снижает затраты на хранение и поиск, но может повлиять на качество совпадений. Поэтому рабочее значение лучше выбирать по тестам на собственных запросах и документах, а не только по объёму векторной базы.

Похожие модели OpenAI

Сравнить соседние версии можно на страницах: text-embedding-3-large; text-embedding-ada-002.

Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.

Официальный источник: материал разработчика.