omni-moderation-latest
omni-moderation-latest — бесплатная модель OpenAI для выявления потенциально вредного текста и изображений в запросах к Moderation API.
OpenAI представила omni-moderation-latest 26 сентября 2024 года как мультимодальную модель для Moderation API. Она оценивает текст и изображения на признаки потенциально вредного содержания и возвращает категории и оценки вероятности. Компания описала её как обновление прежней текстовой модерации, построенное на GPT-4o.
Текстовая и визуальная модерация
Категории риска с оценками
Модель проверяет текст и изображения по категориям, включая ненависть, насилие, самоповреждение и сексуальный контент. В анонсе OpenAI уточнялось, что на старте распознавание изображений применялось к части категорий, а остальные оставались текстовыми. Ответ API содержит оценки и метки — приложение использует их в своих правилах проверки, очереди ручной модерации или фильтрации.
Что важно учитывать
Вероятностная оценка — не готовое решение о публикации
OpenAI сообщила о более точной калибровке оценок и улучшении результатов на неанглоязычных материалах в собственном тесте 40 языков. Порог блокировки нужно подбирать под конкретную площадку, язык и допустимый уровень ошибок. Модель помогает сортировать и отмечать материалы, но не знает внутренних правил сайта, если приложение не сопоставит категории с собственной политикой.
Доступ через API
Псевдоним с обновляемой моделью
Название omni-moderation-latest указывает на обновляемую версию в Moderation API. Анонс OpenAI отмечал, что endpoint доступен разработчикам бесплатно с ограничениями по уровню использования. Для воспроизводимой оценки сохраняйте примеры запросов и регулярно проверяйте качество при обновлении псевдонима; текущие категории и ограничения нужно сверять с документацией.
Похожие модели OpenAI
Сравнить соседние версии можно на страницах: gpt-oss-safeguard-120b; gpt-oss-safeguard-20b.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.