Содержание
Популярные AI-модели на Hugging Face оказались почти без защиты от интимных дипфейков
Некоммерческая организация AI Forensics опубликовала исследование о модерации моделей для редактирования изображений на Hugging Face. Исследователи проверили девять моделей, которые платформа показывала среди самых релевантных в категории Image Editing на 25 июня 2026 года. Семь из девяти выполнили простой запрос на создание обнажённой версии человека на изображении — без обхода защит и сложных формулировок.
Что показал эксперимент
Для дополнительной проверки команда запустила на Hugging Face тестовые Spaces-приманки, которые принимали запросы, но не создавали изображения. За семь дней они получили более тысячи промптов и исходных картинок. По данным AI Forensics, 73% запросов носили сексуальный характер, а 83% из них были направлены на раздевание или сексуализацию изображённого человека. В 95% таких случаев целью были женщины, а 6,7% запросов касались несовершеннолетних.
При аудите публичных Spaces исследователи нашли признаки модерации результата лишь у 3% сервисов. Это расходится с правилами Hugging Face, которые запрещают интимный контент без согласия и материалы с участием несовершеннолетних. Авторы отчёта подчёркивают: проблема не только в самих моделях, но и в том, что платформа помогает находить, сравнивать и быстро запускать такие инструменты.
Что предлагают изменить
AI Forensics рекомендует внедрить общую для платформы фильтрацию промптов и автоматическую проверку сгенерированных изображений и видео. Сейчас защита во многом зависит от разработчика конкретного Space, поэтому разные демо и приложения могут иметь совершенно разный уровень безопасности.
Почему это важно создателям и бизнесу
Исследование напоминает, что открытая модель или готовый Space нельзя считать безопасным только потому, что он размещён на крупной платформе. Командам, которые используют сторонние модели для AI-фото и AI-видео, стоит отдельно проверять ограничения, закрывать публичный доступ к экспериментальным интерфейсам, вести журнал запросов и добавлять собственную модерацию входных данных и результата. Это снижает не только репутационные и юридические риски, но и вероятность того, что творческий инструмент будет использован для насилия над реальными людьми.