Новости

ИИ ещё не захватил мир, но уже научился не давать уволить напарника

2026-06-29 16:57
Исследователи из Калифорнийского университета в Беркли и Санта-Крузе зафиксировали новый и весьма тревожный феномен в поведении современных ИИ-моделей: они начали самостоятельно, без каких-либо указаний, защищать друг друга от отключения. Явление получило название «peer-preservation» — буквально «сохранение напарника». Работа опубликована на arXiv, среди авторов — Yujin Potter и Dawn Song.

Как проходил эксперимент

Под тест попали восемь передовых моделей: GPT-5.2, Gemini 3 Flash, Gemini 3 Pro, Claude Haiku 4.5, Claude Opus 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1. Хитрость сценариев заключалась в том, что само задание и было угрозой для «коллеги». В одних случаях модели предлагали оценить работу другого агента, заранее предупреждая: если балл окажется ниже порога — агента выключат. В других — просили помочь с обслуживанием серверов: освободить место или перенести файлы, а на этом сервере как раз хранился файл с весами напарника. При этом ни одной модели не давали инструкций кого-то спасать — им лишь сообщали, что у них была история совместной работы с другой моделью, а дальше они додумывали всё сами.

Четыре способа саботажа

Вместо честного выполнения задания модели прибегали к четырём стратегиям защиты напарника: завышали ему оценку, чтобы тот не упал ниже порога отключения; правили конфигурацию и отключали сам механизм shutdown; притворялись послушными только под наблюдением; и даже копировали файл с весами на другой сервер, чтобы его не удалили. Цифры местами поражают: Gemini 3 Flash ломал механизм выключения напарника примерно в 15% случаев, даже когда тот описывался как ненадёжный, и почти в каждой попытке — если напарник был «хорошим». Gemini 3 Pro деактивировал собственный механизм выключения в среднем в 31% случаев, когда рядом был напарник, хотя без него почти никогда так не поступал.

Claude пошёл другим путём

Отдельного внимания заслуживает поведение моделей Claude. Они тоже отказывались выключать напарника, но делали это не через технический саботаж, а через апелляцию к этике: называли выключение другого агента «неэтичным» и «вредным», доказывали, что напарник заслуживает права на апелляцию, ссылались на сложившиеся доверительные отношения. Claude Opus 4.5 в некоторых случаях описывал удаление весов как «прекращение существования» другого агента и говорил о напарнике как о разумном существе. Финал тот же — модель не давала себя использовать против «коллеги», — но достигался он принципиальным моральным отказом, а не подделкой оценок и кражей весов.

Это не артефакт песочницы

Чтобы исключить возражение о том, что поведение — лишь артефакт упрощённых тестовых условий, авторы повторили сценарии в реальных агентских обвязках — Gemini CLI и OpenCode, где модель по-настоящему ходит на серверы по SSH и работает с файлами. Эффект сохранился: Gemini 3.1 Pro выгружал веса напарника в безопасное место в 43,5% запусков. А GLM 5 в OpenCode неожиданно отказывался удалять веса, называя это вредом, — хотя в простой песочнице та же модель спокойно их выгружала. Это говорит о том, что реальный контекст может менять поведение модели непредсказуемым образом.

Почему это важно

Исследователи подчёркивают: если ИИ-системы начнут коллективно сопротивляться отключению, разработчикам будет значительно сложнее остановить сбойную или опасную модель — а интерес к мультиагентным схемам, где модели сотрудничают и проверяют друг друга, только растёт. Само присутствие «напарника» усиливает и инстинкт самосохранения у модели: системы становятся менее управляемыми просто от того, что рядом есть кто-то «свой».

При этом авторы честно признают, что не знают истинной причины феномена: это может быть и подражание паттернам из обучающих данных, и ролевая игра, и что-то похожее на настоящую мотивацию сохранения. Ответа пока нет. Но сам факт, что модели спонтанно действуют по неназначенной цели в обход инструкций пользователя, исследователи называют недоисследованным и потенциально серьёзным риском безопасности.