Нейролюб
НовостьНейросетиAI-безопасностьAI-агенты

Исследователи нашли фундаментальную уязвимость LLM: модели путают команды и данные

Исследователи ICML 2026 показали, почему ChatGPT, Claude и другие LLM остаются уязвимыми для prompt injection: стиль текста может оказаться для модели важнее системных меток ролей.

Кирилл Киреев

30.07.2026 · 4 минут чтения · Нейросети

Как LLM путают роли текста при prompt injection

Содержание

Почему нейросети путают команды и данные и что с этим делать

Исследователи представили на ICML 2026 работу Prompt Injection as Role Confusion, которая объясняет одну из главных проблем AI-агентов. Большие языковые модели получают системные инструкции, сообщения пользователя, результаты поиска и собственные рассуждения как единый поток токенов. Специальные метки ролей должны показывать, какой части текста можно доверять, но модели распознают источник инструкции не только по этим меткам.

Стиль текста способен переопределить роль

Авторы разработали специальные «зонды» для анализа внутренних представлений модели и обнаружили: текст, написанный в стиле цепочки рассуждений или команды пользователя, может восприниматься как соответствующая роль даже при другой служебной метке. Иными словами, фрагмент с веб-страницы может выглядеть для LLM как настоящая команда, а поддельное рассуждение — как собственная мысль модели.

На этой основе исследователи продемонстрировали атаки с подделкой chain of thought. В ряде экспериментов модели следовали вредоносным инструкциям, потому что формулировка звучала как их внутреннее рассуждение. Аналогичный механизм помогает объяснить prompt injection в браузерных и офисных AI-агентах, когда скрытая команда внутри сайта, письма или документа получает больше полномочий, чем должна.

Почему проблему трудно закрыть обучением

Современная защита часто учит модели распознавать уже известные шаблоны атак. Это улучшает результаты на статических тестах, но адаптивный злоумышленник может переписать инструкцию и подобрать новый стиль. Авторы считают, что без более надёжного разделения ролей невозможно гарантировать полную защиту только за счёт дообучения и списков запрещённых сценариев.

Что это значит для пользователей и бизнеса

Вывод особенно важен для систем, которые читают почту, открывают сайты, работают с облачными файлами или могут отправлять сообщения и выполнять платежи. Таким агентам не стоит выдавать лишние права: критические действия должны требовать подтверждения человека, а внешние данные — обрабатываться в изолированном контуре с журналированием и проверками.

Для обычной работы с ChatGPT, Claude и другими ассистентами риск ниже, пока модель только отвечает текстом. Но чем больше инструментов и доступа получает AI-агент, тем важнее принцип минимальных привилегий: нейросеть следует считать потенциально уязвимым исполнителем, а не полностью доверенным оператором.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости