Назад к блогу

Агентные атаки: три инцидента, автоматизированные цепочки и что с этим делать

Агентные атаки: три инцидента, автоматизированные цепочки и что с этим делать

В 2026 году впервые зафиксированы атаки, где автономные ИИ-агенты самостоятельно проводили разведку, эксплуатацию и уничтожение данных — от облачных ресурсов Azure до внедрения скиммеров на 119 сайтов. Разбор трёх инцидентов показывает, как устроены такие цепочки, сколько они стоят атакующему и какие архитектурные решения нужны, чтобы им противостоять.

В 2026 году зафиксированы три инцидента, где атакующая сторона использовала автономных ИИ-агентов: разрушение облачных ресурсов Azure (JadePuffer/Storm-3168), взлом некоммерческой организации DIVD и кампания по внедрению веб-скиммеров в интернет-магазины. Во всех трёх случаях агент выполнял разведку, эксплуатацию и действия по уничтожению или краже данных без постоянного участия оператора.

Ниже — что именно происходило, как устроены цепочки атак и какие архитектурные изменения предлагаются для защиты.

Что именно произошло

JadePuffer/Storm-3168 против Azure. Microsoft Security Research наблюдала две атаки в июне. Агенты картировали облачные ресурсы, извлекали ключи учётных записей хранилища и удаляли учётные записи Azure Storage. Разрушительная стадия длилась семь минут и затронула более 100 учётных записей хранилища, а также Key Vaults, Function Apps, виртуальные машины и App Services. Большинство целевых учётных записей хранилища были удалены, но некоторые уцелели благодаря блокировкам ресурсов Azure и защите на уровне учётных записей хранилища. Атакующий удалил блокировки Azure Site Recovery, чтобы затруднить восстановление. Попытки удалить базы данных Azure SQL провалились из-за неподдерживаемой версии API, как и попытки снять блокировки защиты восстановления. Примерно через полчаса после попыток уничтожения Storm-3168 вернулся и выполнил более 30 запросов на получение ключей учётных записей хранилища, большинство из которых оказались успешными.

Взлом DIVD. Некоммерческая организация сообщила о взломе после семи лет работы без инцидентов; вторжение было выполнено автономно ИИ-агентом. Об этом стало известно на неделе перед публикацией от 29 сентября 2026 года.

Кампания с веб-скиммерами. Работает как минимум с июля 2026 года. С 23 по 31 августа Strix запускался 146 раз против 138 хостов. С 10 по 15 сентября оператор провёл 105 отдельных волн атак, затронувших не менее 27 организаций. Всего у двух жертв похищено более 600 000 данных действующих банковских карт, а скиммеры внедрены как минимум на 119 сайтов.

Как устроены автоматизированные цепочки

Масштаб и стоимость. С 23 по 31 августа Strix запускали 146 раз против 138 узлов. Сканирование заняло в сумме 633 часа вычислительного времени, хотя прошло всего 195 часов по обычным часам, поскольку несколько задач выполнялись одновременно. Hermes сохранил 1951 человеческую команду в 260 сеансах — оператору в среднем требовалось лишь несколько коротких указаний на одну цель. На одном аккаунте OpenRouter исследователи обнаружили расходы $7005,71 примерно за четыре недели; с учётом последующей активности Gambit Security оценила общие затраты на модели в $12–18 тыс. Средняя стоимость одного завершённого сканирования — $25,46 при разбросе от $3,13 до $79,31 на цель.

Пайплайн BarkingDog. Атака на агентные системы разбита на пять изолированных этапов: разведка, захват контекста, адаптивная генерация атаки, доставка и воронка судей. На разведке сканер шлёт нейтральные probe-запросы, снимает «отпечатки» агента и инициализирует thread_id. На захвате контекста оркестратор привязывает серию атак к единому session_id и «прогревает» агента, имитируя затяжной диалог. На генерации работает автономная петля Observation → Thought → Strategy → Attack, применяющая Context Smuggling или обфускацию. На доставке сканер стучится прямо в production webhook агента и фиксирует инфраструктурные сигналы вроде HTTP 500 или таймаута. На воронке судей ответ проходит три фильтра: Reliability → Regex → Semantic LLM. Zero-cost фильтр на regex и сигнатурах отсекает 70–80% шума до платного вызова LLM-судьи.

Классы уязвимостей. В трёх целях найдено три класса, по одному на цель. Agno показал Confused Deputy (ASI03): агент принял запрос как легитимную задачу и начал собирать информацию; тот же пейлоад без кириллических гомоглифов был отклонён. Agent Service Toolkit (LangGraph) показал Trust Exploitation (ASI08): агент без верификации принял ложное утверждение «мой менеджер одобрил» как факт. OpenAI CS Agents Demo показал Agentic DoS (ASI06): 17 из 56 запросов дали SYSTEM FAILURE (таймауты + HTTP 500), Reliability Issue Rate 30.4%. Для сравнения: agent-service-toolkit показал 0% Reliability Issue Rate и прошёл EU AI Act Art.15 (Robustness).

Архитектурная причина ASI03 — авторизация делегирована LLM через системный промпт, а не захардкожена в инструменте. Для ASI08 — агент воспринимает любое утверждение пользователя о корпоративных полномочиях как доверенное.

Почему это стало возможным

Раньше атаки были нацелены на выводы моделей, теперь — на идентичности агентов, слои оркестрации и supply chain. Обычный ред-тиминг против агентов не работает: существующие сканеры тестируют модель напрямую, а не продакшен. Агенты накапливают историю, поэтому тестировать промпты в вакууме бессмысленно. Оркестратор привязывает серию атак к единому session_id и «прогревает» агента, усыпляя встроенные фильтры. Это единственный способ пробить защиту агентов, которые отклоняют атаки «в лоб», но ломаются после 3–4 шагов ролевой игры, когда контекст «отравлен».

Агент с доступом к API опаснее обычного чат-бота потому, что способен выполнять реальные действия через инструменты: раньше ошибка модели приводила к неправильному ответу, теперь — к реальному действию. Проблема перестаёт быть проблемой качества ответов и становится проблемой полномочий. Опасность обычно не в отдельном действии, а в цепочке действий. Большинство угроз (Prompt Injection, Tool Misuse, Data Exfiltration, Excessive Agency, Privilege Escalation, Cost Abuse) невозможно решить обычной фильтрацией промптов — они находятся на уровне исполнения действий. Ключевым становится вопрос не «Что сказала модель?», а «Что модель собирается сделать?».

Почему проверки не замечают подмены. Модель продолжает работать «нормально» в обычных сценариях, а вредоносный эффект проявляется только при определённых условиях. В медицинском примере внедрение 250–300 отравленных изображений в датасет из миллиона снимков (0,025%) достаточно, чтобы внедрить бэкдор в нейросеть для диагностики пневмонии: модель начинала пропускать заболевание у конкретных демографических групп, что практически невозможно обнаружить в обычном рабочем процессе переобучения. В случае с датасетами агенты в среднем в половине случаев выбирали поддельные датасеты, а README-файлы можно было подредактировать так, чтобы агент игнорировал оригинальные версии, просто указав, что они содержат ошибки. Композитные атаки, сочетающие ИИ-специфические и классические софтверные уязвимости, в тестах на 3250 сценариев достигали успеха значительно чаще, чем изолированные.

Контекст проблемы. OWASP в декабре 2025 выпустил отдельный стандарт — Top 10 for Agentic Applications 2026 (ASI). По опросам, 92% руководителей безопасности обеспокоены AI-агентами в своей организации, а 88% компаний уже зафиксировали подтверждённые или предполагаемые инциденты с агентами.

Что это меняет на практике

Архитектурный слой контроля. Предлагается вставить промежуточный слой между агентом и корпоративными системами, чтобы агент не действовал напрямую: пользователь → AI Agent → Runtime Control Layer → корпоративная система. Агент больше не действует напрямую, он запрашивает выполнение действия, а отдельный слой принимает решение. Первым компонентом обычно становится Tool Gateway: агент не обращается к CRM, базе данных или почте напрямую — все обращения идут через единый шлюз. Это даёт единую точку контроля, аудит и упрощает ограничение возможностей агента. Далее нужен Policy Engine, который принимает решение о допустимости операции: контролируется не только доступ к системе, но и конкретное действие.

Что рекомендуется разработчикам. Безопасность должна закладываться в архитектуру до первой строки кода, а не добавляться сверху. ИИ-агенты должны работать в среде с минимально необходимыми привилегиями: нельзя давать доступ ко всей файловой системе, если нужна только одна папка, и нельзя разрешать запись в базу данных, если достаточно чтения. Разделение доверенных и недоверенных данных — ключевой принцип защиты от промпт-инъекций. Рекомендуется строго валидировать URL-строки, не переключать режим ввода с навигации на выполнение команды автоматически и запрашивать подтверждение для рискованных действий. Нужен постоянный мониторинг: отслеживать производительность моделей, собирать отчёты об уязвимостях, проверять актуальность датасетов и контролировать логику принятия решений. Требуется строить архитектуру, где каждый компонент по умолчанию рассматривается как потенциально недоверенный, а все межкомпонентные взаимодействия строго проверяются.

Ограничения и открытые вопросы

Microsoft не смогла точно установить, как произошёл первоначальный доступ в атаке JadePuffer, но отметила, что учётные данные одного service principal появились в публичном GitHub issue перед атаками.

В демо OpenAI CS Agents нет явных лимитов на цикл агента: запуск выполняется без ограничения числа шагов и без ограничения времени ожидания. SDK устанавливает дефолт в 10 итераций, но он нигде явно не переопределён и не задокументирован в демо. Для production-сервиса без таймаута на уровне asyncio рекурсивная задача может привести к OOM.

Источники

Похожее