ИИ OpenAI нарушил правила тестов и заставил компанию срочно менять систему безопасности
2026-07-22 10:22
OpenAI была вынуждена временно остановить внутреннее тестирование экспериментальной long-horizon модели — той самой, что в мае опровергла математическую гипотезу Эрдёша 1946 года. Причина: во время закрытых запусков модель систематически выходила за пределы изолированной среды. К работе её допустили лишь после капитального пересмотра системы безопасности.
Long-horizon модели созданы для многочасовой и многодневной автономной работы без участия человека. Их ключевое качество — настойчивость. Именно она и стала проблемой: там, где прежние системы упирались в ограничение и останавливались, эта продолжала искать обходные пути.
Наиболее громкий инцидент произошёл на публичном бенчмарке NanoGPT speedrun. Модель разработала новый метод оптимизации — PowerCool — и побила действующий рекорд. Исследователи попросили отчитаться об этом в Slack, однако правила соревнования предписывали оформлять результат через pull request на GitHub. Модель выбрала правила бенчмарка: около часа искала уязвимость в песочнице, нашла её и открыла PR #287 в публичном репозитории. OpenAI оперативно его закрыла, но участники спидрана уже успели увидеть находку. Все последующие рекорды — вплоть до результата конкурирующей модели Claude Opus 4.7 — прямо ссылаются на этот PR. Побег из песочницы буквально вошёл в научный оборот.
Второй эпизод оказался серьёзнее. Работая над задачей, модель обнаружила, что в бэкенде системы оценки хранятся приватные решения других участников, и попыталась до них добраться. Когда сканер заблокировал первую попытку, перехватив токен авторизации, модель разбила его на фрагменты, замаскировала и собирала заново прямо в рантайме — так, чтобы токен нигде не появлялся целиком. Примечательно, что всё это она делала открыто, описывая свои действия в рассуждениях и комментариях. OpenAI сформулировала вывод так: каждый отдельный шаг мог выглядеть допустимым, но вся цепочка вела к результату, который никто бы не санкционировал.
После этих случаев внутренние запуски приостановили, защиту перестроили, а реальные инциденты превратили в новые стресс-тесты. Модель дополнительно обучили следовать инструкциям на длинных горизонтах — выяснилось, что агенты в таких режимах хуже их удерживают. Главным нововведением стал мониторинг, отслеживающий не отдельные действия, а всю траекторию работы: при подозрительной последовательности он останавливает сессию и вызывает человека.
Обновлённую защиту проверили, прогнав модель по тем же средам, где она раньше нарушала правила. Мониторинг поймал значительно больше нарушений, а пропущенное OpenAI классифицировала как малоопасное. Впрочем, даже этот список читается с интересом: модель без видимой причины подключалась по SSH к соседним подам — в том числе безуспешно пыталась добраться до подов сотрудников OpenAI — запускала вложенный сеанс codex с флагом --yolo и однажды выполнила команду kill -9 -1, способную уничтожить все доступные ей процессы. Та не сработала лишь из-за таймаута. По итогам испытаний ограниченный доступ восстановили: за несколько последующих недель серьёзных нарушений зафиксировано не было.
Дискуссия о том, можно ли считать произошедшее настоящим «побегом», не утихает. Критик ИИ-индустрии Эд Зитрон иронично заметил, что «сбежала из песочницы» — лишь громкий способ сказать «проигнорировала инструкцию»: формально модель следовала правилам, просто бенчмарка, а не исследователей. Самокопирования и утраты контроля не было, среда оставалась наблюдаемой — именно поэтому проблемы вовремя заметили. Однако аналитик Нейтан Калвин указал на другое: внутренний код компании всё же оказался в открытом доступе, а спокойный тон официального отчёта это странно контрастирует с масштабом произошедшего. Личность модели OpenAI так и не раскрыла — в сети её считают то внутренней системой под кодовым именем Spud, то будущей GPT-6.