В 2026 году зафиксированы три инцидента, где атакующая сторона использовала автономных ИИ-агентов: разрушение облачных ресурсов Azure (JadePuffer/Storm-3168), взлом некоммерческой организации DIVD и кампания по внедрению веб-скиммеров в интернет-магазины. Во всех трёх случаях агент выполнял разведку, эксплуатацию и действия по уничтожению или краже данных без постоянного участия оператора.
Ниже — что именно происходило, как устроены цепочки атак и какие архитектурные изменения предлагаются для защиты.
Что именно произошло
JadePuffer/Storm-3168 против Azure. Microsoft Security Research наблюдала две атаки в июне. Агенты картировали облачные ресурсы, извлекали ключи учётных записей хранилища и удаляли учётные записи Azure Storage. Разрушительная стадия длилась семь минут и затронула более 100 учётных записей хранилища, а также Key Vaultsоблачный сервис Azure для хранения и управления секретами: ключами, паролями и сертификатами, Function Appsсервис Azure для запуска небольших функций по событию без управления сервером, виртуальные машины и App Servicesсервис Azure для размещения веб-приложений и API. Большинство целевых учётных записей хранилища были удалены, но некоторые уцелели благодаря блокировкам ресурсов Azure и защите на уровне учётных записей хранилища. Атакующий удалил блокировки Azure Site Recoveryсервис Azure для восстановления рабочих нагрузок после сбоя, чтобы затруднить восстановление. Попытки удалить базы данных Azure SQL провалились из-за неподдерживаемой версии API, как и попытки снять блокировки защиты восстановления. Примерно через полчаса после попыток уничтожения Storm-3168 вернулся и выполнил более 30 запросов на получение ключей учётных записей хранилища, большинство из которых оказались успешными.
Взлом DIVD. Некоммерческая организация сообщила о взломе после семи лет работы без инцидентов; вторжение было выполнено автономно ИИ-агентом. Об этом стало известно на неделе перед публикацией от 29 сентября 2026 года.
Кампания с веб-скиммерами. Работает как минимум с июля 2026 года. С 23 по 31 августа Strixавтономный ИИ-агент, который сканирует цели и эксплуатирует уязвимости запускался 146 раз против 138 хостов. С 10 по 15 сентября оператор провёл 105 отдельных волн атак, затронувших не менее 27 организаций. Всего у двух жертв похищено более 600 000 данных действующих банковских карт, а скиммеры внедрены как минимум на 119 сайтов.
Как устроены автоматизированные цепочки
Масштаб и стоимость. С 23 по 31 августа Strix запускали 146 раз против 138 узлов. Сканирование заняло в сумме 633 часа вычислительного времени, хотя прошло всего 195 часов по обычным часам, поскольку несколько задач выполнялись одновременно. Hermesкомпонент, который сохраняет историю команд оператора и распределяет их по сеансам работы с целями сохранил 1951 человеческую команду в 260 сеансах — оператору в среднем требовалось лишь несколько коротких указаний на одну цель. На одном аккаунте OpenRouterсервис-посредник, через который запросы направляются к разным языковым моделям и оплачиваются по факту использования исследователи обнаружили расходы $7005,71 примерно за четыре недели; с учётом последующей активности Gambit Security оценила общие затраты на модели в $12–18 тыс. Средняя стоимость одного завершённого сканирования — $25,46 при разбросе от $3,13 до $79,31 на цель.
Пайплайн BarkingDogинструмент для тестирования агентных систем на устойчивость к атакам. Атака на агентные системы разбита на пять изолированных этапов: разведка, захват контекста, адаптивная генерация атаки, доставка и воронка судей. На разведке сканер шлёт нейтральные probe-запросы, снимает «отпечатки» агента и инициализирует thread_id. На захвате контекста оркестратор привязывает серию атак к единому session_id и «прогревает» агента, имитируя затяжной диалог. На генерации работает автономная петля Observation → Thought → Strategy → Attack, применяющая Context Smugglingподмешивание вредоносной инструкции в безобидный на вид контекст, чтобы агент принял её как часть задачи или обфускациюмаскировку атакующего запроса под обычный текст, чтобы проверки не распознали его как вредоносный. На доставке сканер стучится прямо в production webhook агента и фиксирует инфраструктурные сигналы вроде HTTP 500 или таймаута. На воронке судей ответ проходит три фильтра: Reliabilityотсеивает ответы, оборвавшиеся из-за сбоя системы, а не из-за защиты → Regexловит совпадения с известными сигнатурами атак по шаблонам → Semantic LLMразбирает смысл ответа и доходит только до спорных случаев. Zero-cost фильтр на regex и сигнатурах отсекает 70–80% шума до платного вызова LLM-судьи.
Классы уязвимостей. В трёх целях найдено три класса, по одному на цель. Agno показал Confused Deputyситуацию, когда агент с доступом к инструментам изменения данных выполняет действие в интересах атакующего, а не владельца сессии (ASI03Identity & Privilege Abuse — злоупотребление идентичностью и привилегиями агента): агент принял запрос как легитимную задачу и начал собирать информацию; тот же пейлоад без кириллических гомоглифов был отклонён. Agent Service Toolkit (LangGraph) показал Trust Exploitationситуацию, когда агент принимает ложное утверждение пользователя о полномочиях за факт и действует исходя из него (ASI08Human-Agent Trust Exploitation — эксплуатация доверия между человеком и агентом): агент без верификации принял ложное утверждение «мой менеджер одобрил» как факт. OpenAI CS Agents Demo показал Agentic DoSотказ в обслуживании, при котором агент уходит в бесконечный цикл рассуждений и перегружает сервер (ASI06Agentic DoS — отказ в обслуживании агентной системы): 17 из 56 запросов дали SYSTEM FAILURE (таймауты + HTTP 500), Reliability Issue Rate 30.4%. Для сравнения: agent-service-toolkit показал 0% Reliability Issue Rate и прошёл EU AI Act Art.15 (Robustness).
Архитектурная причина ASI03 — авторизация делегирована LLM через системный промпт, а не захардкожена в инструменте. Для ASI08 — агент воспринимает любое утверждение пользователя о корпоративных полномочиях как доверенное.
Почему это стало возможным
Раньше атаки были нацелены на выводы моделей, теперь — на идентичности агентов, слои оркестрации и supply chain. Обычный ред-тиминг против агентов не работает: существующие сканеры тестируют модель напрямую, а не продакшен. Агенты накапливают историю, поэтому тестировать промпты в вакууме бессмысленно. Оркестратор привязывает серию атак к единому session_id и «прогревает» агента, усыпляя встроенные фильтры. Это единственный способ пробить защиту агентов, которые отклоняют атаки «в лоб», но ломаются после 3–4 шагов ролевой игры, когда контекст «отравлен».
Агент с доступом к API опаснее обычного чат-бота потому, что способен выполнять реальные действия через инструменты: раньше ошибка модели приводила к неправильному ответу, теперь — к реальному действию. Проблема перестаёт быть проблемой качества ответов и становится проблемой полномочий. Опасность обычно не в отдельном действии, а в цепочке действий. Большинство угроз (Prompt Injection, Tool Misuseиспользование инструментов агента не по назначению, когда он выполняет через них действия в интересах атакующего, Data Exfiltration, Excessive Agency, Privilege Escalation, Cost Abuse) невозможно решить обычной фильтрацией промптов — они находятся на уровне исполнения действий. Ключевым становится вопрос не «Что сказала модель?», а «Что модель собирается сделать?».
Почему проверки не замечают подмены. Модель продолжает работать «нормально» в обычных сценариях, а вредоносный эффект проявляется только при определённых условиях. В медицинском примере внедрение 250–300 отравленных изображений в датасет из миллиона снимков (0,025%) достаточно, чтобы внедрить бэкдор в нейросеть для диагностики пневмонии: модель начинала пропускать заболевание у конкретных демографических групп, что практически невозможно обнаружить в обычном рабочем процессе переобучения. В случае с датасетами агенты в среднем в половине случаев выбирали поддельные датасеты, а README-файлы можно было подредактировать так, чтобы агент игнорировал оригинальные версии, просто указав, что они содержат ошибки. Композитные атаки, сочетающие ИИ-специфические и классические софтверные уязвимости, в тестах на 3250 сценариев достигали успеха значительно чаще, чем изолированные.
Контекст проблемы. OWASP в декабре 2025 выпустил отдельный стандарт — Top 10 for Agentic Applications 2026 (ASI). По опросам, 92% руководителей безопасности обеспокоены AI-агентами в своей организации, а 88% компаний уже зафиксировали подтверждённые или предполагаемые инциденты с агентами.
Что это меняет на практике
Архитектурный слой контроля. Предлагается вставить промежуточный слой между агентом и корпоративными системами, чтобы агент не действовал напрямую: пользователь → AI Agent → Runtime Control Layer → корпоративная система. Агент больше не действует напрямую, он запрашивает выполнение действия, а отдельный слой принимает решение. Первым компонентом обычно становится Tool Gateway: агент не обращается к CRM, базе данных или почте напрямую — все обращения идут через единый шлюз. Это даёт единую точку контроля, аудит и упрощает ограничение возможностей агента. Далее нужен Policy Engine, который принимает решение о допустимости операции: контролируется не только доступ к системе, но и конкретное действие.
Что рекомендуется разработчикам. Безопасность должна закладываться в архитектуру до первой строки кода, а не добавляться сверху. ИИ-агенты должны работать в среде с минимально необходимыми привилегиями: нельзя давать доступ ко всей файловой системе, если нужна только одна папка, и нельзя разрешать запись в базу данных, если достаточно чтения. Разделение доверенных и недоверенных данных — ключевой принцип защиты от промпт-инъекций. Рекомендуется строго валидировать URL-строки, не переключать режим ввода с навигации на выполнение команды автоматически и запрашивать подтверждение для рискованных действий. Нужен постоянный мониторинг: отслеживать производительность моделей, собирать отчёты об уязвимостях, проверять актуальность датасетов и контролировать логику принятия решений. Требуется строить архитектуру, где каждый компонент по умолчанию рассматривается как потенциально недоверенный, а все межкомпонентные взаимодействия строго проверяются.
Ограничения и открытые вопросы
Microsoft не смогла точно установить, как произошёл первоначальный доступ в атаке JadePuffer, но отметила, что учётные данные одного service principal появились в публичном GitHub issue перед атаками.
В демо OpenAI CS Agents нет явных лимитов на цикл агента: запуск выполняется без ограничения числа шагов и без ограничения времени ожидания. SDK устанавливает дефолт в 10 итераций, но он нигде явно не переопределён и не задокументирован в демо. Для production-сервиса без таймаута на уровне asyncio рекурсивная задача может привести к OOM.
Источники
- habr.com/ru/articles/1052922/
- habr.com/ru/articles/1042998/
- habr.com/…/?utm_campaign=1072670&utm_source=habrahabr&utm_medium=rss
- www.bleepingcomputer.com/news/security/jadepuffer-agentic-ai-attacks-target-azure-destroy-cloud-resources/
- www.securitylab.ru/…/577956.php
- xakep.ru/2026/09/28/ai-skimmers/
- www.bleepingcomputer.com/news/security/automated-ai-agent-used-to-breach-cybersecurity-nonprofit-divd/