omni-moderation-latest

omni-moderation-latest — бесплатная модель OpenAI для выявления потенциально вредного текста и изображений в запросах к Moderation API.

OpenAI представила omni-moderation-latest 26 сентября 2024 года как мультимодальную модель для Moderation API. Она оценивает текст и изображения на признаки потенциально вредного содержания и возвращает категории и оценки вероятности. Компания описала её как обновление прежней текстовой модерации, построенное на GPT-4o.

Текстовая и визуальная модерация

Категории риска с оценками

Модель проверяет текст и изображения по категориям, включая ненависть, насилие, самоповреждение и сексуальный контент. В анонсе OpenAI уточнялось, что на старте распознавание изображений применялось к части категорий, а остальные оставались текстовыми. Ответ API содержит оценки и метки — приложение использует их в своих правилах проверки, очереди ручной модерации или фильтрации.

Что важно учитывать

Вероятностная оценка — не готовое решение о публикации

OpenAI сообщила о более точной калибровке оценок и улучшении результатов на неанглоязычных материалах в собственном тесте 40 языков. Порог блокировки нужно подбирать под конкретную площадку, язык и допустимый уровень ошибок. Модель помогает сортировать и отмечать материалы, но не знает внутренних правил сайта, если приложение не сопоставит категории с собственной политикой.

Доступ через API

Псевдоним с обновляемой моделью

Название omni-moderation-latest указывает на обновляемую версию в Moderation API. Анонс OpenAI отмечал, что endpoint доступен разработчикам бесплатно с ограничениями по уровню использования. Для воспроизводимой оценки сохраняйте примеры запросов и регулярно проверяйте качество при обновлении псевдонима; текущие категории и ограничения нужно сверять с документацией.

Похожие модели OpenAI

Сравнить соседние версии можно на страницах: gpt-oss-safeguard-120b; gpt-oss-safeguard-20b.

Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.

Официальный источник: материал разработчика.