Нейролюб
НовостьНейросетиOpenAIAI-инструменты

OpenAI открыла gpt-oss-safeguard — AI-модель модерирует контент по правилам бизнеса

OpenAI выпустила открытые модели gpt-oss-safeguard на 20 и 120 млрд параметров. Они проверяют контент по политике компании и объясняют решение.

Кирилл Киреев

17.08.2026 · 4 минут чтения · Нейросети

AI-система проверяет потоки контента по настраиваемым правилам безопасности

Содержание

OpenAI выпустила открытый AI-модератор с настраиваемыми правилами

OpenAI представила gpt-oss-safeguard — семейство открытых reasoning-моделей для проверки контента. В него вошли версии на 20 и 120 млрд параметров, которые уже можно скачать с Hugging Face и использовать по свободной лицензии Apache 2.0.

Модель читает правила, а не угадывает их

Вместо обучения отдельного классификатора на тысячах размеченных примеров разработчик передаёт модели собственную политику прямо во время запроса. gpt-oss-safeguard одновременно получает правила и проверяемый текст, после чего выдаёт решение и объясняет ход рассуждений.

Это позволяет быстро менять критерии модерации без переобучения. Например, игровая платформа может искать обсуждения читов, маркетплейс — подозрительные отзывы, а сервис с пользовательским контентом — применять отдельные нормы к разным категориям публикаций.

Подходит для новых и сложных рисков

OpenAI рекомендует подход для ситуаций, где угрозы быстро меняются, правила содержат много нюансов или у команды пока недостаточно данных для обучения собственного фильтра. По внутренним тестам новые модели обошли обычные gpt-oss и GPT-5 Thinking в задаче одновременной проверки по нескольким политикам.

При этом компания предупреждает о компромиссах: reasoning-модерация требует больше вычислений и работает медленнее простых классификаторов. Для массовых платформ практичнее комбинировать быстрый предварительный фильтр с более вдумчивой проверкой только спорного контента.

Почему это важно бизнесу и креаторам

Релиз даёт компаниям готовую основу для собственной модерации без привязки к закрытому API и фиксированному набору запретов. Это особенно полезно для сообществ, UGC-платформ, маркетплейсов и AI-сервисов, которым нужно прозрачно объяснять решения, учитывать контекст и быстро обновлять правила.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости