Содержание
Что обнаружили исследователи и как защитить AI-логи
Команда исследователей из MATS Research, ELLIS Institute Tübingen, Max Planck Institute и других организаций обнаружила способ извлекать скрытые рассуждения моделей из API OpenAI, Anthropic и Google. Проблема связана с зашифрованными блоками chain-of-thought: сервис возвращает их клиенту, а затем принимает обратно для продолжения диалога.
Как работает атака
Выяснилось, что такие блоки можно переносить между сессиями, пользователями и моделями одного провайдера. Исследователи брали зашифрованный reasoning-трейс сильной модели, передавали его более слабой модели того же семейства и с помощью джейлбрейка заставляли её вывести скрытое рассуждение открытым текстом. Сильную модель при этом напрямую не атаковали, поэтому её защита от извлечения данных могла не сработать.
В публичных логах оказались реальные секреты
Авторы проанализировали 6 708 открытых траекторий AI-агентов с GitHub и Hugging Face и восстановили 315 320 блоков рассуждений. В них обнаружили 704 уникальных фрагмента чувствительных данных, включая 62 API-ключа, 33 пароля, 24 токена доступа и 30 личных email-адресов. В 64 случаях информация находилась только внутри скрытых рассуждений и не появлялась в видимой части сессии.
Риск не ограничивается утечкой секретов. По данным работы, метод также помогает обходить защиту от дистилляции, раскрывать опасные детали, которые модель скрыла в финальном ответе, и внедрять невидимые инструкции в зашифрованные блоки. Авторы сообщили о проблеме провайдерам до публикации исследования и предложили криптографические и системные меры защиты.
Что это значит для разработчиков и бизнеса
Главный практический вывод — зашифрованный reasoning-блок нельзя считать безопасным только потому, что он не читается человеком. Логи AI-агентов перед публикацией нужно очищать целиком, не переносить служебные блоки между проектами и пользователями, а случайно попавшие в них ключи и пароли немедленно отзывать. Компаниям также стоит проверить, сохраняют ли их системы полные ответы API в публичных репозиториях, трассировщиках и датасетах.
Для создателей AI-продуктов это напоминание о новой категории рисков: чувствительные данные могут оказаться не в финальном ответе, а во внутреннем контексте агента. Поэтому аудит должен охватывать не только сообщения пользователя и видимый результат, но и служебные поля, подписи и зашифрованные состояния модели.