Содержание
Shieldstral: гибкая AI-модерация текста и изображений
Mistral представила Shieldstral — открытую мультимодальную модель для проверки безопасности текста и изображений. Вместо жёстко зашитого списка запретов она принимает правила модерации на обычном языке и выдаёт оценку вероятности того, что контент им нарушает.
Правила можно менять без переобучения
В запросе разработчик задаёт контекст, вопрос с ответом «да» или «нет» и сам материал для проверки. Shieldstral умеет анализировать пользовательские промпты, ответы нейросетей, пары «запрос — ответ», изображения и сочетания картинки с текстом. Это позволяет одной модели обслуживать разные продукты: от образовательных сервисов до площадок с пользовательским контентом.
3 млрд параметров и запуск на одной GPU
Модель содержит 3 млрд параметров и, по данным Mistral, запускается на одной видеокарте NVIDIA с 16 ГБ памяти. Компания утверждает, что Shieldstral сопоставима или лучше открытых защитных моделей в семь раз крупнее на задачах текстовой безопасности, распознавания отказов и мультимодальной модерации. Вместо одного жёсткого вердикта система возвращает калиброванную оценку, поэтому команда может сама выбрать порог блокировки.
Почему это важно для креаторов и бизнеса
Для сервисов с AI-контентом это способ добавить собственные правила без отдельного обучения классификатора: например, по-разному проверять рекламные креативы, комментарии, изображения пользователей или ответы чат-бота. Shieldstral опубликована с открытыми весами по лицензии Apache 2.0, поэтому модель можно развернуть на своей инфраструктуре и встроить в существующий пайплайн модерации.