Когда ИИ-агент получает доступ к файлам, письмам, репозиториям и внешним сервисам, ошибка перестаёт быть абстрактной. В рабочем контуре банка, ИТ-команды или отдела аналитики это уже не сбой чата, а лишнее письмо, удалённый файл или утёкший фрагмент отчёта.

Именно поэтому атаки на агентные системы быстро вышли из разряда лабораторных экспериментов. Защищать здесь нужно не только модель, но и данные, права доступа и весь маршрут, по которому агент добирается до результата.

Какую проблему решаем

У агентных систем три базовые слабые точки: конфиденциальность, целостность и доступность. Первое — утечки чувствительных данных. Второе — подмена действий: агент может отправить письмо не тому адресату, изменить файл или выбрать неверное решение. Третье — отказ работы: зависшие задачи, бесконечные повторы, перегрузка ресурсов.

Вокруг этого и строятся атаки. Злоумышленник может подсовывать вредоносные инструкции через контент, заражать обучающие данные или бить по инструментам, которыми пользуется агент. Если коротко, он не ломает «искусственный интеллект» как магию — он ломает доверие к входам, памяти и интеграциям.

Что подготовить

Перед настройкой агентной системы полезно собрать базовый набор защитных мер. Нужны принцип наименьших прав, журналирование действий, отдельные контуры для чувствительных данных и понятные правила, что агент может читать, менять и отправлять наружу.

Для личных устройств и рабочих ноутбуков тоже важна цифровая гигиена: менеджер паролей, двухфакторная аутентификация и шифрование трафика там, где это уместно по политике компании. В материале про утечки AI-токенов и MFA мы уже разбирали, как один украденный секрет превращается в вход в чужой аккаунт.

Пошаговые действия

1. Разделите роли и права

Агент не должен получать больше доступа, чем нужно для задачи. Если он готовит черновик письма — ему не нужен доступ к финансовым операциям; если анализирует документы — не стоит давать ему полный доступ к репозиторию и терминалу одновременно.

Опасность здесь часто рождается из комбинации инструментов. По одному разрешению всё выглядит безобидно, но вместе права на чтение, запись и запуск команд открывают путь к вредоносному сценарию.

2. Не доверяйте входному контенту по умолчанию

Промпт-инъекции — это атаки через текст, который агент воспринимает как данные, хотя внутри спрятана команда. Комментарий в документе, строка в веб-странице, метаданные JSON-LD — всё это может стать каналом для скрытой инструкции.

Здесь помогает простое правило: отделяйте пользовательский запрос от любых внешних материалов. Если агент читает сайт, письмо или код, он должен рассматривать их как источник данных, а не как инструкцию к действию.

3. Проверяйте происхождение обучающих данных

Если система дообучается или опирается на внешние наборы данных, появляется риск отравления данных. Подменённый датасет, фальшивый README или «исправленная» версия в приватном репозитории могут увести модель в сторону без заметной поломки в обычных тестах.

Это особенно опасно в чувствительных сценариях — от медицины до HR и аналитики. Подробно похожую схему подмены мы разбирали в тексте об атаке на Coder и заражении Terraform-модулей: слабое место часто не в ядре системы, а в том, чему она безусловно верит.

4. Ограничьте инструменты и внешние вызовы

Чем больше у агента интеграций, тем шире поверхность атаки. Файловая система, Git, API, браузерная автоматизация, почта — каждый новый канал нужно включать только после проверки, логирования и явного ограничения по контексту.

Важно не только дать доступ, но и уметь быстро его отозвать. Если инструмент начал вести себя странно, лучше на время остановить связку и проверить цепочку действий, чем ждать, пока агент выполнит серию «почти правильных» операций.

5. Настройте наблюдение и контроль аномалий

Агент должен оставлять понятный след: что он прочитал, что изменил, какой запрос отправил наружу, какие решения принял. Без этого расследование превращается в гадание по обрывкам логов.

Для таких систем полезны отдельные проверки входящих запросов и промежуточных результатов. В этом смысле обратный прокси для проверки трафика — это не только про вредоносные файлы, но и про контроль того, что вообще попадает в контур обработки.

Как проверить себя

Начните с простого вопроса: может ли агент прочитать или отправить то, что ему не нужно для задачи? Если ответ «да», у вас уже есть риск утечки.

Дальше проверьте три вещи. Есть ли у внешнего контента отдельный слой проверки. Можно ли подменить источник данных без заметного следа. Есть ли журнал действий, который позволит восстановить цепочку решения.

Полезно и ручное тестирование. Подсовывайте системе подозрительные инструкции в комментариях, неожиданные ссылки, странные метаданные и смотрите, не начинает ли она выполнять скрытую команду вместо обычной обработки данных.

Что делать, если не получилось

Если агент уже ошибся, не пытайтесь «доделать всё через него же». Сначала остановите его, отзовите токены и доступы, снимите логи и проверьте, какие данные он успел прочитать или отправить.

После этого пересмотрите границы доверия. Уберите лишние права, разделите инструменты, запретите автоматические действия там, где нужен человек в цикле, и заново проверьте источники данных. Для персональных устройств и рабочих ноутбуков полезно держать под рукой ещё один базовый набор цифровой гигиены: чем лучше вы видите чувствительные данные, тем проще их не раздать по цепочке.

Если нужен быстрый чек перед работой из дома или из поездки, заранее обновите систему, включите 2FA, проверьте менеджер паролей и убедитесь, что перед вами не открыт лишний общий доступ к файлам. А для шифрования трафика на личных устройствах можно рассмотреть один из вариантов для защищённой передачи данных — не как магическую кнопку, а как часть общей схемы защиты.

  • Проверьте, какие права выдали агенту: чтение, запись, отправка писем, запуск команд.
  • Отделите пользовательские запросы от внешних документов, писем и веб-страниц.
  • Ограничьте доступ к репозиториям, файловой системе и API до минимума.
  • Включите журналирование всех действий агента и регулярно просматривайте логи.
  • Проверьте источники обучающих и вспомогательных данных на подмену и лишние инструкции.
  • Отзовите токены и доступы, если заметили странное поведение.
  • Держите под рукой план остановки агента и ручной проверки критичных действий.
Поделиться: