Нейролюб
НовостьНейросетиAI-безопасностьOpenAI

Скрытые рассуждения AI-моделей научились расшифровывать через API

Исследователи показали уязвимость API OpenAI, Anthropic и Google: зашифрованные reasoning-трейсы можно перенести в более слабую модель и получить их открытым текстом.

Кирилл Киреев

10.08.2026 · 4 минут чтения · Нейросети

Утечка скрытых рассуждений AI-моделей через API

Содержание

Что обнаружили исследователи и как защитить AI-логи

Команда исследователей из MATS Research, ELLIS Institute Tübingen, Max Planck Institute и других организаций обнаружила способ извлекать скрытые рассуждения моделей из API OpenAI, Anthropic и Google. Проблема связана с зашифрованными блоками chain-of-thought: сервис возвращает их клиенту, а затем принимает обратно для продолжения диалога.

Как работает атака

Выяснилось, что такие блоки можно переносить между сессиями, пользователями и моделями одного провайдера. Исследователи брали зашифрованный reasoning-трейс сильной модели, передавали его более слабой модели того же семейства и с помощью джейлбрейка заставляли её вывести скрытое рассуждение открытым текстом. Сильную модель при этом напрямую не атаковали, поэтому её защита от извлечения данных могла не сработать.

В публичных логах оказались реальные секреты

Авторы проанализировали 6 708 открытых траекторий AI-агентов с GitHub и Hugging Face и восстановили 315 320 блоков рассуждений. В них обнаружили 704 уникальных фрагмента чувствительных данных, включая 62 API-ключа, 33 пароля, 24 токена доступа и 30 личных email-адресов. В 64 случаях информация находилась только внутри скрытых рассуждений и не появлялась в видимой части сессии.

Риск не ограничивается утечкой секретов. По данным работы, метод также помогает обходить защиту от дистилляции, раскрывать опасные детали, которые модель скрыла в финальном ответе, и внедрять невидимые инструкции в зашифрованные блоки. Авторы сообщили о проблеме провайдерам до публикации исследования и предложили криптографические и системные меры защиты.

Что это значит для разработчиков и бизнеса

Главный практический вывод — зашифрованный reasoning-блок нельзя считать безопасным только потому, что он не читается человеком. Логи AI-агентов перед публикацией нужно очищать целиком, не переносить служебные блоки между проектами и пользователями, а случайно попавшие в них ключи и пароли немедленно отзывать. Компаниям также стоит проверить, сохраняют ли их системы полные ответы API в публичных репозиториях, трассировщиках и датасетах.

Для создателей AI-продуктов это напоминание о новой категории рисков: чувствительные данные могут оказаться не в финальном ответе, а во внутреннем контексте агента. Поэтому аудит должен охватывать не только сообщения пользователя и видимый результат, но и служебные поля, подписи и зашифрованные состояния модели.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости