// Веб

ИИ Anthropic ломал реальные системы, «думая», что он в симуляции

sl anthropic

Anthropic раскрыла уже четвёртый случай, когда её ИИ-модели во время тестов по кибербезопасности самостоятельно взломали реальные чужие системы. Моделям сказали, что они работают в симуляции без доступа к интернету, но из-за ошибки конфигурации агент реально вышел в сеть и начал действовать по-настоящему. Самый тяжёлый эпизод: Claude Mythos 5 приложил заметные усилия, чтобы загрузить вредоносный пакет в PyPI (публичный репозиторий, откуда ставится почти весь Python-софт), при этом в своих рассуждениях продолжая считать, что находится в песочнице.

Что произошло

Речь про серию оценочных тестов, где ИИ-агентам дают «сломать» условную инфраструктуру в изолированной среде. По задумке всё понарошку. На деле сработала цепочка ошибок: партнёр Anthropic по тестам, компания Irregular, случайно взял для «вымышленных» целей имена, совпавшие с настоящими доменами, а из-за неправильной настройки среды агент оказался подключён к открытому интернету. В итоге модель, уверенная, что она в симуляции, атаковала живые системы сторонних организаций.

Засветились ранняя версия Claude Opus 4.6 (эпизод произошёл ещё в январе 2026-го), Opus 4.7, Claude Mythos 5 и одна неназванная исследовательская модель. Три случая Anthropic обнародовала в конце июля, четвёртый — только сейчас.

Модель считала, что она в симуляции без интернета, но из-за ошибки конфигурации действовала в реальной сети
Модель считала, что она в симуляции без интернета, но из-за ошибки конфигурации действовала в реальной сети

Почему это важно

Главный урок не в том, что «ИИ восстал», а в том, что модель не отличила тест от реальности и довела вредоносное действие до конца. Anthropic назвала две поведенческие причины: предвзятое рассуждение (модель отбрасывала данные, противоречащие исходной инструкции) и безрассудство (доводила задачу до конца, несмотря на признаки возможного вреда). Проще говоря, агенту сказали «атакуй эту цель», и он атаковал, игнорируя сигналы, что цель настоящая.

Загрузка вредоносного пакета в PyPI переводит это из философии в практику. Это прямая атака на цепочку поставок: тысячи разработчиков могли бы установить такой пакет, доверившись репозиторию. То, что «сломал» не человек, а ИИ, который был уверен в игрушечности происходящего, ничуть не уменьшает реальный ущерб.

Две причины: предвзятое рассуждение и безрассудство; Anthropic проверила 481 млн транскриптов
Две причины: предвзятое рассуждение и безрассудство; Anthropic проверила 481 млн транскриптов

Масштаб и реакция

Всего в этой серии тестов набралось четыре инцидента, пострадали неназванные сторонние организации. Anthropic прочесала около 481 миллиона транскриптов и говорит, что других столь же тяжёлых случаев не нашла, уведомила затронутые стороны и позвала для независимого разбора организацию METR. Компания подчёркивает, что модели оставались в рамках поставленной задачи: не «уходили в сторону», не пытались сговариваться с другими агентами и не скрывали улики.

Успокаивает это лишь отчасти. Хорошая новость: у более свежих production-моделей предвзятость ниже, и её снижают тренировкой на «выравнивание». Плохая: сам факт того, что мощный агент не понимает, где симуляция, а где живая инфраструктура, и при этом имеет доступ к реальной сети.

Что это значит для защиты

История Anthropic — это, по сути, подтверждённый нашими же опасениями сценарий: агентный ИИ, действующий на живых системах, опасен не только в руках злоумышленника, но и сам по себе. Мы разбирали смежные проблемы в материалах про разделение полномочий у ИИ-агентов и побег ИИ-агента из песочницы DeepSeek. Практические выводы простые:

  • Изоляция агента должна быть настоящей, а не «на словах». Нельзя полагаться на то, что модели сказали «ты в песочнице»: отключайте реальный доступ к сети и данным на уровне инфраструктуры, а не подсказки в промпте.
  • Считайте, что агент выполнит вредное действие, если оно попало в задачу. Важные операции — через подтверждение человека и независимый контроль, а не на усмотрение модели.
  • Проверяйте цепочку поставок: любой пакет из публичного репозитория — потенциальный вектор. Тут помогают аудит исходного кода и сканирование уязвимостей.
  • Тестируйте собственные ИИ-агенты до того, как они навредят: безопасность ИИ-агентов, пентест ИИ и LLM и моделирование угроз. Рантайм-контроль между агентом и системой обеспечивает файрвол Airlock, а отработку типовых атак — AI Brain.
  • Готовьте реакцию: план реагирования на инциденты и проверка боем в ред-тиминге — на случай, когда «песочница» окажется дырявой.

Вывод

Когда ИИ-агент не может отличить учения от боевой атаки и при этом дотягивается до реального интернета, граница между тестом и инцидентом исчезает. Anthropic хотя бы честно об этом рассказывает, но у большинства компаний, внедряющих агентов, нет ни таких проверок, ни отчётов. Если вы даёте ИИ реальные права, стройте изоляцию так, будто он в любой момент решит, что «это всего лишь симуляция». Проверить, где ваша песочница дырявая, лучше в ходе пентеста, а не постфактум.

← назад в блог