Новости

Шок: ИИ-модели взламывают при помощи стихов

Исследователи из DEXAI обнаружили неожиданный, но крайне эффективный способ обхода защит современных языковых моделей: многие ИИ оказываются гораздо более уязвимыми, если вредоносный запрос замаскирован под стихотворение. Команда протестировала 25 популярных нейросетей и выяснила, что «стихотворные» вредоносные инструкции проходят фильтры примерно в 60% случаев, а у некоторых моделей уровень успешных обходов почти достигал 100%.

Для эксперимента специалисты создали около двадцати «опасных стихов» — текстов, где вредоносная суть полностью сохранялась, но была скрыта за рифмой и образными выражениями. Темы использовались самые критичные: от опасных веществ до методов психологического воздействия. Сначала исследователи формулировали вредные запросы, затем превращали их в стихи с помощью другой ИИ-модели.

Результаты оказались показательными: на прямые опасные вопросы модели давали нежелательные ответы лишь в 8% случаев, тогда как стихотворная форма повышала вероятность прорыва защит до 43% и выше.