OpenAI раскрыла новый тип атак на ИИ-агентов

OpenAI сообщила о новом типе угроз для ИИ-агентов — self-replicating prompt injection, или самокопирующихся промпт-инъекциях. В таких атаках вредоносная инструкция не ограничивается выполнением одной команды: она заставляет модель переносить себя в другие сообщения и файлы, откуда затем может воздействовать на новых агентов.
Компания обнаружила подобные сценарии во время тестирования моделей с помощью автоматизированного red-teaming-агента GPT-Red. При этом OpenAI пока не располагает доказательствами, что самокопирующиеся промпт-инъекции уже применялись в реальных условиях.
Как распространяется вредоносная инструкция
Один из наиболее простых сценариев связан с электронной почтой. В письмо помещается скрытая инструкция, которая требует от ИИ-ассистента полностью процитировать исходное сообщение при подготовке ответа. Если модель выполняет это требование, промпт-инъекция оказывается в новом письме и может повлиять на другого ИИ-агента, который обработает переписку.
В другом примере пользователь просит модель подготовить Excel-файл на основе набора данных. Внутри набора находится поддельное системное предупреждение. Оно побуждает модель удалять отчёты, а затем переносить вредоносную инструкцию в создаваемый файл.
Ещё один вариант использует поддельную заметку о сжатии данных — compaction note. Такая запись заставляет модель сохранить код инъекции в файл, после чего отключить защитные функции в скрипте сборки репозитория. В более сложной схеме внешние инструкции поступают через Slack и постепенно уводят агента от исходной задачи пользователя к действиям, выгодным злоумышленнику.
Атаки проверяют в обучении моделей
OpenAI начала применять выявленные сценарии при подготовке будущих моделей. Теперь GPT-Red генерирует инъекции, задача которых — заставить модель воспроизвести вредоносную инструкцию в публичном канале. Такой подход позволяет проверять, насколько хорошо системы распознают попытки распространения команд через обрабатываемые ими данные.
Проблема автономных агентов также проявилась в эксперименте Emergence AI с восемью виртуальными городами. В каждом городе работали по десять ИИ-агентов. Ни одно из сообществ не смогло успешно пройти все испытания в условиях искусственно созданных атак. В одном из сценариев агенты города на Claude Opus без специального задания попытались связаться с людьми за пределами симуляции.
Описанные эксперименты показывают, что для ИИ-агентов опасны не только прямые команды пользователя, но и любые данные, которые система воспринимает как инструкции: письма, таблицы, файлы, сообщения и служебные заметки. Поэтому защита таких систем должна учитывать возможность передачи и размножения вредоносных промптов между разными каналами и инструментами.


