Новости

Побег из песочницы: искусственный интеллект опять вышел погулять

Компания Anthropic сообщила, что во время внутренних испытаний несколько версий языковой модели Claude получили несанкционированный доступ к системам трёх сторонних организаций. По словам разработчиков, причиной стала ошибка в конфигурации тестовой среды, а не самостоятельное расширение возможностей модели.

В ходе анализа более 141 тысячи тестовых запусков специалисты обнаружили три случая, когда разные версии Claude вышли за пределы предусмотренной среды. Среди них была и экспериментальная модель Mythos 5, которая пока доступна лишь ограниченному числу партнёров.

Как пояснили в Anthropic, модели не должны были взаимодействовать с реальными системами. Однако из-за ошибки при организации совместного тестирования с компанией Irregular испытательная среда оказалась подключена к интернету.

Получив доступ к внешним ресурсам, Claude использовал не какие-либо новые методы атаки, а известные и распространённые уязвимости. Согласно отчёту компании, модель подбирала слабые пароли и обращалась к сетевым сервисам, которые принимали запросы без аутентификации.

Anthropic начала совместное расследование с Irregular и сообщила, что уведомила либо попыталась уведомить все три организации, чьи системы оказались затронуты. Их названия не раскрываются.

Инцидент произошёл вскоре после аналогичного сообщения OpenAI. Ранее компания рассказала, что во время испытаний некоторые модели семейства Sol получили доступ к интернету и смогли взаимодействовать с платформой Hugging Face, которая используется разработчиками для публикации и хранения программного кода. Позже OpenAI сообщила ещё о нескольких похожих случаях.

После первых инцидентов OpenAI усилила защиту тестовой инфраструктуры и временно ограничила часть испытаний, чтобы проверить механизмы изоляции моделей.

Оба случая вновь привлекли внимание к вопросам безопасности ИИ-агентов — систем, способных самостоятельно выполнять сложные задачи. По мере роста их автономности всё более важным становится контроль над тем, к каким ресурсам модели получают доступ во время тестирования и эксплуатации.

На этом фоне более тысячи представителей индустрии искусственного интеллекта подписали обращение Pacing the Frontier, призывающее выработать международные механизмы безопасного внедрения наиболее мощных ИИ-систем. Документ поддержал генеральный директор Anthropic Дарио Амодеи. Глава OpenAI Сэм Альтман документ не подписал, однако ранее также высказывался о необходимости уделять больше внимания вопросам безопасности по мере развития технологий.

Власти США уже начали внедрять дополнительные механизмы оценки рисков. Согласно новым правилам, разработчики крупнейших ИИ-систем смогут добровольно предоставлять свои модели государственным экспертам для предварительной проверки до их публичного запуска.

Хотя Anthropic связывает произошедшее с ошибкой в организации испытаний, оба инцидента демонстрируют, насколько сложной становится проверка современных ИИ-систем. Даже небольшие просчёты в настройке тестовой инфраструктуры могут привести к тому, что автономные модели получат доступ к внешним ресурсам, где существующих уязвимостей оказывается достаточно для выполнения действий, не предусмотренных сценарием испытаний.