
ИИ-агент — это языковая модель, которая не просто отвечает текстом, а совершает действия: вызывает инструменты и API, читает файлы, выполняет код, ходит в интернет. Это одновременно самый полезный и самый опасный класс ИИ-систем: если агента удаётся заставить действовать через prompt-инъекцию, его полномочия превращают утечку в реальный ущерб. Собрали 7 правил, которые снижают риск на порядок.
Почему агент опаснее чат-бота
Обычный чат-бот в худшем случае скажет лишнее. Агент с инструментами может отправить письмо, изменить запись в базе, выполнить команду или потратить деньги. В терминах OWASP Top 10 для LLM это сочетание двух угроз — Excessive Agency (избыточные полномочия) и Prompt Injection. Именно на их стыке происходят самые дорогие инциденты.
7 правил защиты ИИ-агента
1. Принцип минимальных привилегий
Агенту нужен ровно тот набор инструментов и прав, без которого он не решит задачу — и ни одним больше. Уберите «на всякий случай» доступ к shell, файловой системе и внешней сети, если он не обязателен.
2. Подтверждение критичных действий
Необратимые операции — отправка сообщений, платежи, удаление данных, изменение прод-конфигурации — должны требовать явного подтверждения человека, а не выполняться автономно по решению модели.
3. Изоляция инструментов и песочница
Каждый инструмент запускайте в изолированном окружении с ограниченными правами. Выполнение кода — только в песочнице без доступа к секретам и внутренней сети.
4. Защита от косвенных инъекций
Считайте любой контент, который агент обрабатывает автоматически (письма, документы, веб-страницы, ответы API), недоверенным. Именно через него проходит косвенная инъекция. Разделяйте «инструкции системы» и «данные для обработки».
5. Валидация ввода и вывода
Проверяйте не только то, что приходит агенту, но и то, что он передаёт дальше — в инструменты, API и пользователю. Вывод модели — это недоверенные данные, а не готовая к исполнению команда.
6. Логирование и мониторинг действий
Пишите полный аудит: какие инструменты вызывал агент, с какими аргументами, по какому запросу. Аномалии (внезапный доступ к чувствительным операциям) должны триггерить алерты.
7. Регулярное состязательное тестирование
Защита, не проверенная атакой, — это предположение. Регулярно прогоняйте Red Team против агента: пытайтесь захватить его действия так, как это сделал бы злоумышленник.
Как это проверить и внедрить
Эти правила — не разовая настройка, а процесс. Мы помогаем на всех этапах: находим уязвимости тестированием безопасности ИИ-агентов, проектируем и внедряем защиту в рамках харденинга ИИ-систем, и проверяем результат Red Teaming LLM.
Ваш ИИ-агент имеет доступ к проду или данным клиентов?
Проверим, можно ли захватить его действия через инъекцию, и поможем закрыть риски.
Смотрите также: Как атакуют LLM: OWASP Top 10 для LLM 2025.