Содержание
Что произошло с биологическими фильтрами Anthropic
Anthropic раскрыла серьёзный пробел в собственной системе AI-безопасности. С мая 2025 года по апрель 2026-го весь трафик на платформах, где внешние подрядчики оценивали ответы моделей и собирали данные для обучения, проходил без блокирующих биологических классификаторов.
По оценке компании, речь идёт примерно о 133 млн обменов с моделями и пуле около 50 тыс. человек. Большинство подрядчиков могли вести с AI открытые диалоги, а проверку их личности и благонадёжности выполняли сторонние поставщики услуг. Anthropic признаёт, что прежние требования к такой проверке во многих случаях не могли остановить даже сравнительно слабо подготовленного злоумышленника.
Почему фильтры не работали
Трафик управлялся внутренним флагом, который отключал не только блокировку потенциально опасных запросов, но и запись срабатываний классификатора. Поэтому подозрительные обращения не попадали в механизмы последующей проверки. Важно: это касалось инфраструктуры для сбора обратной связи от подрядчиков, а не пользовательского ChatGPT-подобного сервиса Claude; данные клиентов, внутренние системы и веса моделей, по словам компании, не были раскрыты.
Что показала повторная проверка
После обнаружения проблемы Anthropic прогнала сохранённые диалоги через Claude Sonnet 5. Модель отметила 1 197 переписок как потенциально связанные с опасной биологической тематикой, но 757 из них принадлежали внутренним командам Anthropic, а почти все остальные — специально организованным red team-тестам. Ручная проверка оставшихся 62 диалогов не выявила явно опасного применения, способного существенно помочь злоумышленнику.
Почему это важно для AI-индустрии
Anthropic уже устранила проблему: теперь биологические классификаторы включены для подавляющего большинства трафика подрядчиков, а исключения разрешаются только для отдельных проектов и поставщиков с усиленными мерами контроля. При этом компания пересмотрела собственную оценку риска для моделей на февраль 2026 года с «очень низкой» до «низкой».
История показывает, что безопасность AI зависит не только от возможностей самой модели. Не менее важны служебные платформы, подрядчики, настройки логирования и контроль доступа. Для бизнеса это практический урок: если AI используется в чувствительных процессах, аудит должен охватывать весь путь данных и все внешние команды, а не только публичный продукт.