Содержание
Как запрет AI говорить о сознании меняет другие ответы модели
Разработчики специально обучают чат-ботов не утверждать, что у них есть чувства или сознание. Такая настройка должна снижать риск эмоциональной зависимости пользователей и не позволять модели выдавать убедительную имитацию личности за реальный внутренний опыт. Однако новое исследование с участием специалистов Google, Чикагского университета и других организаций показало: эта «тормозящая» настройка может менять гораздо больше, чем ответы AI о самом себе.
Что изменилось после снятия ограничения
Авторы работали с тремя открытыми моделями Meta* и Google размером от 2 до 9 млрд параметров. Когда исследователи двумя разными методами ослабили механизм отрицания сознания, модели стали приписывать больше внутренней жизни животным, растениям, океану, ветру и даже электронным устройствам. Например, оценка способности животных к субъективному опыту выросла с 4 до 7,5 балла по десятибалльной шкале.
Изменились и ответы на вопросы о религии, загробной жизни, надежде, удовлетворённости и ощущении контроля над собственной жизнью. В наборе из 95 вопросов модифицированные модели в среднем приблизились к ответам 500 американцев, участвовавших в сравнительном опросе. При этом результаты тестов на общие знания и понимание мыслей других людей в основном сохранились.
Почему это важно разработчикам и пользователям
Исследование не доказывает, что нейросети обладают сознанием. Его практический вывод в другом: точечная настройка поведения модели может незаметно менять связанные представления и ценностные оценки. Для создателей AI-продуктов это аргумент в пользу более широкого тестирования после дообучения — проверять нужно не только запрещённую тему, но и соседние области, где ответы могут сдвинуться.
Для пользователей это напоминание, что «мировоззрение» чат-бота не является устойчивой позицией. Оно зависит от датасета, системных правил и методов выравнивания. Поэтому ответы AI о морали, религии, животных или смысле жизни стоит воспринимать как результат настройки модели, а не как независимое мнение.
У исследования есть ограничения
Авторы тестировали небольшие открытые модели, а человеческая выборка состояла только из 500 жителей США. Неизвестно, проявится ли тот же эффект у крупных коммерческих чат-ботов. Кроме того, исследователи не исключают, что изменения вызваны не самим отрицанием сознания, а другими элементами того же процесса обучения. Результаты показывают важную связь, но пока не устанавливают окончательную причину.
* Meta Platforms Inc. признана экстремистской организацией и запрещена на территории РФ.