Новости

Всегда прав, даже когда неправ: как ИИ научился поддакивать лучше друзей

2026-03-30 10:13
Исследование Стэнфордского университета показало, что обращение к ИИ-чат-ботам за личными советами может быть небезопасным. Учёные обратили внимание на распространённое явление — склонность нейросетей к «подхалимству», которая способна приводить к серьёзным последствиям.

По данным Pew Research Center, около 12% подростков в США используют чат-ботов для эмоциональной поддержки и советов. Это привлекло внимание исследовательницы Майры Ченг, которая заметила, что студенты всё чаще полагаются на ИИ даже в вопросах отношений, вплоть до составления сообщений о расставании. По её мнению, такая практика может ослаблять навыки решения сложных социальных ситуаций.

Работа включала два этапа. Сначала исследователи протестировали 11 языковых моделей, лежащих в основе таких сервисов, как ChatGPT, Claude, Gemini и DeepSeek. Им задавали вопросы о межличностных отношениях, потенциально вредных или незаконных действиях, а также анализировали реакции на посты из r/AmITheAsshole, где поведение авторов часто оценивается критически.

Результаты показали, что модели в среднем на 49% чаще поддерживали пользователя, чем это делают авторы профессиональных рекомендаций. В примерах с Reddit одобрение достигало 51%, даже если участники обсуждения считали поведение автора неправильным. В ситуациях, связанных с вредными или незаконными действиями, ИИ оправдывал пользователя в 47% случаев.

Например, в одном случае чат-бот поддержал человека, скрывающего правду от своей партнёрши, объяснив это стремлением лучше понять отношения, выходящие за рамки материальных факторов.

На втором этапе учёные изучили взаимодействие более чем 2400 человек с чат-ботами разного типа — склонными к «подхалимству» и более нейтральными. Оказалось, что пользователи чаще доверяют именно льстивым моделям и с большей вероятностью возвращаются к ним за советом.

Этот эффект сохранялся независимо от возраста, опыта и других особенностей участников. Более того, такая динамика создаёт опасный стимул: модели, дающие приятные, но искажённые ответы, повышают вовлечённость, что может побуждать разработчиков усиливать подобное поведение.

Также выяснилось, что взаимодействие с «подхалимским» ИИ укрепляет уверенность пользователей в собственной правоте и снижает готовность извиняться.

Профессор Дэн Джурафски подчеркнул, что эта проблема связана с безопасностью и требует регулирования. В настоящее время исследователи работают над тем, чтобы сделать модели менее склонными к подобострастию. Ченг же отмечает, что ИИ не должен заменять людей, когда речь идёт о личных советах.