text-embedding-3-small
text-embedding-3-small — компактная модель OpenAI, которая преобразует текст или код в векторы для поиска, группировки и извлечения связанных материалов.
OpenAI представила text-embedding-3-small 25 января 2024 года. Модель преобразует текст или код в числовое представление — вектор, по которому система может искать смысловую близость между материалами. Эмбеддинги используют в поиске по базе знаний, группировке документов и подборе контекста для генеративных приложений.
Для чего нужны векторы
Смысловой поиск и работа с корпусом данных
Векторное представление помогает находить близкие по смыслу тексты даже при несовпадении ключевых слов. Это применяется в поиске по документам, рекомендациях, кластеризации и системах с извлечением контекста. text-embedding-3-small сама не пишет ответы и не является чат-моделью: она возвращает вектор, который затем сравнивает приложение или векторное хранилище.
Размерность и стоимость
Баланс качества и ресурсов
В анонсе OpenAI text-embedding-3-small описана как более компактная и эффективная модель относительно предыдущего поколения. Для сравнения, компания сообщила о среднем результате 44,0% против 31,4% у ada-002 в своём тесте многоязычного поиска MIRACL и о снижении цены API на 80%. Это результаты внутреннего сравнения OpenAI на указанных наборах данных, а не гарантия такого же прироста на каждом корпусе.
Настройка под хранилище
Можно сократить длину вектора
Семейство text-embedding-3 поддерживает параметр dimensions, который позволяет получить векторы меньшей длины. Уменьшение размерности снижает затраты на хранение и поиск, но может повлиять на качество совпадений. Поэтому рабочее значение лучше выбирать по тестам на собственных запросах и документах, а не только по объёму векторной базы.
Похожие модели OpenAI
Сравнить соседние версии можно на страницах: text-embedding-3-large; text-embedding-ada-002.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.