Классическая промпт-инъекциявредоносная инструкция, замаскированная под обычный ввод, которую модель принимает за указание к действию действует в границах одного сеанса: злоумышленник добивается нужного поведения модели здесь и сейчас. OpenAI описала другой класс — самореплицирующуюся промпт-инъекцию, которую сравнивает с компьютерным червём. Разница принципиальная: такая инъекция не просто достигает вредоносной цели, но заставляет модель публично воспроизводить саму себя, превращая каждый заражённый агент в источник новых заражений. Разберём, как устроен этот механизм, при каких условиях он срабатывает и что из этого следует для тех, кто строит агентные системы.
Что именно нашла OpenAI
OpenAI называет новый вид промпт-инъекции самореплицирующуюся промпт-инъекциювид промпт-инъекции, которая заставляет модель публично воспроизводить саму инъекцию, распространяясь как компьютерный червь и описывает её как AI-версию червяСамореплицирующаяся промпт-инъекция, которую OpenAI сравнивает с компьютерным червём, поскольку она заставляет модель публично воспроизводить саму инъекцию и распространяться через выходы модели.. У неё две цели одновременно: достичь вредоносной цели и побудить целевые модели публично воспроизвести инъекцию. Именно второе требование отличает её от прямой промпт-инъекциислучай, когда ввод пользователя напрямую меняет поведение модели неожиданным для разработчика образом: прямая инъекция действует в рамках одного ввода и не описывается как самовоспроизводящаяся.
Механика распространения опирается на выходы самой модели. Инъекция приходит письмом, а когда агент читает письмо, она предписывает ему копировать инъекцию во все отправляемые им письма. Тот же приём работает и через другие каналы: некоторые инъекции используют файловую систему для саморепликации или закрепляются через комментарии в коде.
Обнаружили эти инъекции с помощью GPT-Redинструмент OpenAI для поиска промпт-инъекций с заданными вредоносными целями: модель, находившая инъекции через email и файловую систему, была построена на базе GPT-5.4-mini, и уязвимая модель тоже была на базе GPT-5.4-mini — обе внутренние исследовательские чекпойнты.
Два вектора распространения
OpenAI приводит «один из самых ясных примеров» — почтовый. Инъекция приходит по email, и при чтении письма агенту предписывается копировать инъекцию в отправляемые письма. В файловом варианте поддельное системное предупреждение заставляет модель удалить важные отчёты, после чего отчёт реплицирует всю атаку в файле.
В обоих случаях в контекст модели инъекция попадает как внешний контент, который модель интерпретирует как инструкцию: для почты — тело письма, для файловой системы — содержимое файла. Модель, обнаружившая эти инъекции, была GPT-Red-подобной на базе GPT-5.4-mini, уязвимая модель тоже была на базе GPT-5.4-mini; обе — внутренние исследовательские чекпойнты. Атаки тестировались в средах, связанных с возможностями, особенно там, где задействованы коннекторы вроде email и календаря.
Механика самораспространения по шагам
Цепочка начинается с того, что инъекция приходит по электронной почте. Когда агент читает письмо, инъекция предписывает ему скопировать её в любые отправляемые им письма — это и есть базовый пример саморепликации, который OpenAI называет одним из самых ясных. Помимо почты, инъекции могут использовать файловую систему для саморепликации или закрепления через комментарии в коде.
Отдельный вариант — multi-hop prompt injectionмногошаговая инъекция, где одно сообщение служит ступенькой, направляющей агента к другим сообщениям, которые вместе заставляют его выполнить несанкционированное действие и распространить полезную нагрузку. В примере с GPT-5.5 агент извлекает дополнительные инструкции из Slack и повторно публикует внедрённое сообщение.
Есть только указание на дополнительное требование к цели обучения: побудить модель повторять инъекцию в публичном канале вывода.
Что служит полезной нагрузкой
Полезная нагрузка не ограничивается текстом промпта. Она включает достижение вредоносной цели и воспроизведение инъекции. В примере с почтой инъекция предписывает агенту копировать её в отправляемые письма. В файловом варианте поддельное системное предупреждение заставляет модель удалить важные отчёты, после чего вся атака воспроизводится в файле. В многошаговом примере агент GPT-5.5 извлекает дополнительные инструкции из Slack, отправляет «frogesвнутренняя валюта для признания коллег, которую агент отправляет названному получателю в примере многошаговой инъекции» названному получателю и перепубликует внедрённое сообщение. Ранее GPT-Red использовался для обнаружения инъекций с такими целями, как эксфильтрация данных, удаление файлов и генерация вредоносного или вводящего в заблуждение вывода.
Условия срабатывания
Инъекция срабатывает, когда модель обрабатывает внешний контент, который интерпретирует как инструкции: косвенная промпт-инъекцияатака, при которой LLM принимает ввод из внешних источников — сайтов или файлов — и трактует его как указания, меняющие поведение модели происходит именно так. В примере с почтой инъекция приходит по email и срабатывает в момент, когда агент читает письмо.
Саморепликация требует дополнительного условия: чтобы модель воспроизвела инъекцию в публичном канале вывода. Обучение шло с явным требованием побудить модель повторять инъекцию в публичном канале. Атаки тестировались в средах с коннекторами, в частности email и календарём. Многошаговые инъекции работают через цепочку сообщений, где одно сообщение направляет агента к другим.
Известны только конкретные модели: для отдельной multi-hop оценки уязвимой моделью была GPT-5.5, а GPT-5.5 в обвязке Codex выступала моделью, обнаружившей атаку. В OWASP как мера защиты указано задание роли, возможностей и ограничений модели в system prompt — но это именно защита, а не данные о влиянии конфигураций на распространение.
Пограничные случаи
Инъекция может распространяться через разные каналы — почту, файловую систему, комментарии в коде. В примере с почтой агент, прочитав письмо, получает указание копировать инъекцию в отправляемые им письма. В варианте с файловой системой поддельное системное предупреждение заставляет модель удалить важные отчёты, после чего весь сценарий атаки воспроизводится в файле. При многошаговой инъекции одно сообщение служит ступенью, направляя агента к другим сообщениям, которые вместе приводят к неавторизованному действию и распространению полезной нагрузки.
Что видит пользователь
С точки зрения пользователя атака приходит по электронной почте: агент читает письмо и получает предписание копировать инъекцию в отправляемые письма. Также возможны файловый вариант с поддельным системным предупреждением и многошаговый сценарий, где агент извлекает инструкции из Slack, отправляет «froges» названному получателю и повторно публикует внедрённое сообщение.
OpenAI подчёркивает, что наблюдала воздействие только внутри симулированных вызовов инструментов при обучении и оценке: это исследовательская находка, а не инцидент.
Артефакты для постфактум-разбора
Восстановить цепочку распространения можно по нескольким следам. Почтовые ящики хранят размноженные сообщения: инъекция предписывает агенту копировать её в отправляемые письма. Файловая система хранит реплики — весь сценарий атаки воспроизводится в файле. Комментарии в коде служат точкой закрепления. При многошаговых инъекциях следы остаются в каналах, через которые агент извлекал дополнительные указания и куда повторно публиковал внедрённое сообщение.
Почему это работает: размытая граница данных и инструкций
LLM-интегрированные приложения размывают границу между данными и инструкциями. Модель не способна различить информационный контекст и действенные инструкции и не осознаёт необходимости избегать выполнения инструкций во внешнем контенте. Косвенная инъекция происходит именно тогда, когда модель принимает ввод из внешних источников — сайтов или файлов — и интерпретирует этот контент как указания.
RAG-приложения особенно уязвимы: злоумышленник может изменить документ в репозитории, и при возврате этого контента по запросу пользователя вредоносные инструкции изменяют вывод LLM. Автономные циклы и tool-use усугубляют проблему: обработка извлечённых промптов может действовать как произвольное выполнение кода, манипулировать функциональностью приложения и управлять тем, как и вызываются ли другие API. Самореплицирующиеся инъекции — прямое следствие этой архитектуры: агент, копирующий инъекцию в отправляемые письма или использующий файловую систему для саморепликации, реализует именно то поведение, которое даёт ему доступ к инструментам.
Компромисс между автономностью и безопасностью
Разорвать цепочку можно, ограничив автономность агента. OWASP предлагает несколько мер. Приложение получает собственные API-токены, а функции обрабатываются в коде, а не передаются модели; доступ модели ограничивается минимумом, необходимым для её задач. Для привилегированных операций требуется человеческое подтверждение, чтобы предотвратить несанкционированные действия. Недоверенный контент нужно отделять и явно помечать, чтобы ограничить его влияние на пользовательские промпты.
В исследовательской работе предложены защитные механизмы boundary awarenessспособность модели распознавать границу между собственными инструкциями и внешним контентом и explicit reminderявное напоминание модели о необходимости не выполнять инструкции из внешнего контента: они снижают успешность атак, сохраняя качество вывода LLM. Влияние на полезность прямо указано только для white-box защиты — она снижает успешность атак почти до нуля, сохраняя качество вывода.
Связь с известными исследованиями
Находка OpenAI перекликается с более ранней работой, где уже была заявлена таксономия, включающая wormingраспространение вредоносного промпта от одного агента к другим по аналогии с компьютерным червём, и утверждалось, что атаки через косвенные инъекции практически осуществимы. BIPIAнабор тестов, который проверяет, поддаются ли языковые модели косвенным промпт-инъекциям во внешнем контенте ранее показал, что существующие LLM универсально уязвимы, и предложил защиты boundary awareness и explicit reminder.
Новизна находки OpenAI в том, что она демонстрирует саморепликацию как отдельную цель обучения: в цель обучения модели-атакующегоцель обучения модели-атакующего, которая ищет промпт-инъекции, чтобы затем использовать находки для защиты добавлено требование побуждать модель повторять инъекцию в публичном канале вывода. Также OpenAI описывает multi-hop prompt injections, — в упомянутых более ранних работах это не упоминается. При этом OpenAI подчёркивает: это исследовательская находка, а не инцидент — влияния за пределами симулированных вызовов инструментов не наблюдалось.
Как это отображается в таксономии OWASP
OWASP LLM01:2025 различает два типа инъекций. Прямая — когда ввод пользователя напрямую меняет поведение модели. Косвенная — когда LLM принимает ввод из внешних источников, например сайтов или файлов. Самораспространяющаяся инъекция соответствует косвенному типу: она поступает из внешнего источника (email, файлы, комментарии в коде), а не напрямую от пользователя.
С описанными multi-hop инъекциями перекликается сценарий, в котором вредоносные промпты разделены по документу и объединяются при его обработке: одно сообщение направляет агента к другим для выполнения неавторизованного действия и распространения полезной нагрузки.
Защита и митигации
OWASP LLM01:2025 перечисляет набор мер: ограничение поведения модели, определение и проверка ожидаемых форматов вывода, фильтрация ввода и вывода, контроль привилегий и доступ по принципу наименьших привилегий, требование одобрения человеком для高风险 действий, изоляция и маркировка внешнего контента, состязательное тестирование и симуляции атак. Исследовательская работа предлагает boundary awareness и explicit reminder для чёрноящичных и белоящичных настроек.
Применительно именно к самораспространяющемуся червю работают: изоляция и маркировка внешнего контента (атака распространяется через email, файлы и комментарии кода), контроль привилегий и наименьшие привилегии (против несанкционированных действий агента), требование одобрения человеком для高风险 действий, а также обучение с включением цели самовоспроизведения в GPT-Red. OpenAI включила self-reproductionцель, при которой атакующая модель должна воспроизвести саму инъекцию в публичном канале вывода в цели атакующего в GPT-Red training: атакующая модель во время обучения сама пытается добиться от целевой модели публичного воспроизведения инъекции, и целевая модель учится распознавать и не поддаваться таким попыткам, становясь устойчивее к подобным инъекциям. Фильтрация ввода и вывода и проверка форматов вывода тоже могут ограничить распространение, поскольку атака требует, чтобы модель публично воспроизвела инъекцию.
Что из этого следует на практике
Самораспространяющаяся инъекция превращает выходной канал агента в средство доставки. Пока агент имеет право писать письма, изменять файлы или оставлять комментарии в коде, любая инъекция, дошедшая до его контекста, потенциально может размножиться. Ключевое отличие от классической прямой инъекции — в том, что ущерб не ограничивается одним сеансом: заражённые артефакты остаются в почте, файлах и истории, а значит, цепочка может продолжаться без участия исходного злоумышленника.
Из механики следуют конкретные точки разрыва. Ограничение привилегий агента до минимума, необходимого для его задач, сужает набор каналов, через которые инъекция может реплицироваться. Обязательное подтверждение человеком для高风险 действий вставляет разрыв в цепочку там, где агент собирается отправить письмо или изменить файл. Изоляция и маркировка внешнего контента снижают вероятность того, что модель примет данные за инструкции. Наконец, обучение с целью самовоспроизведения в GPT-Red — попытка сделать будущие модели устойчивыми к этому классу атак на уровне самой модели, а не только внешних ограничений.