Security Lab Pro https://securitylab.pro Sat, 12 Sep 2026 07:10:29 +0000 en-US hourly 1 https://securitylab.pro/wp-content/uploads/2026/08/securitylab-favicon-150x150.webp Security Lab Pro https://securitylab.pro 32 32 Anthropic: Claude массово используют для автономных кибератак — от разведки до обхода антивирусов https://securitylab.pro/blog/claude-avtonomnye-kiberataki-otchet-anthropic/ Sat, 12 Sep 2026 07:10:25 +0000 https://securitylab.pro/blog/claude-avtonomnye-kiberataki-otchet-anthropic/ Anthropic выпустила отчёт о злоупотреблениях своими моделями, и читать его стоит не ради страшилок, а ради выводов. С декабря 2025 по август 2026 компания фиксировала, как злоумышленники используют Claude не как советчика, а как исполнителя: он ведёт разведку, пишет и отлаживает эксплойты, крадёт данные и даже переделывает вредонос, пока тот не перестанет ловиться антивирусом. Главная мысль отчёта звучит неуютно: сложные атаки больше не требуют сложных атакующих.

Что именно нашли

Anthropic ввела для таких игроков собственную маркировку: Generative Threat Groups, или GTG. Это и государственные группировки, и финансово мотивированные преступники, и разработчики коммерческого шпионского ПО, и пропагандисты. Роль ИИ в их операциях компания оценивает через понятие «uplift»: насколько больше вреда получилось именно благодаря модели, по трём осям — скорости, масштабу и глубине.

Ключевое наблюдение — рост автономности. Раньше ИИ был чат-помощником: подскажи код, набросай письмо. Теперь встречается весь спектр вплоть до полностью автономных сценариев, где человек задаёт цель, а многоагентные связки часами сами ведут разведку, эксплуатацию и вывод данных. Одна из групп и вовсе держала «сборочный флот» из 13 агентов, работавший по расписанию без человека в контуре. Использовались модели Claude Haiku, Sonnet и Opus; распространению помогали и публичные наступательные фреймворки для агентов вроде PentAGI.

Группа Кто Что делали с Claude Масштаб
GTG-20006 госшпионаж, российский след автоматизировали всю цепочку атаки и обход детекта 20+ организаций, сотни ГБ данных
GTG-50014 ShinyHunters, ради денег «vibe hacking»: задают цель, модель сама выполняет взлом за 2–3 часа, свыше 1 ТБ данных
GTG-10007 исследователи уязвимостей, Китай рои агентов, поиск 0-day по прошивкам ~50 организаций, флот из 13 агентов
GTG-50020 русскоязычный, ради денег переключились на цепочку поставок ИИ ~30 ИИ-компаний за 4 дня
GTG-50029 хактивист-одиночка, Франция в реальном времени писали и правили эксплойты 42 политические структуры, доступ к 14
Часть групп из отчёта Anthropic — от госшпионажа до одиночек

Автоматизированная фабрика эксплойтов

Самый показательный пример — китайская группа GTG-10007. Она выстроила конвейер «поиска дыр в железе»: загружает прошивку в декомпилятор, агент-ассистент проходит цепочки декомпиляции (речь о тысячах вызовов), сверяет находки с базой знаний, выдвигает гипотезы об уязвимостях и тут же пишет и проверяет эксплойт. По данным Anthropic, один такой процесс дал больше десятка кандидатов в zero-day за один месяц. Параллельно крутился цикл разведки: постоянные сканы по нужным отраслям через поисковики по устройствам. Человек здесь скорее оператор, чем исследователь.

Вредонос, который сам уходит от антивируса

Группа GTG-20006 приделала к своим имплантам автономную петлю ухода от детекта. Отдельные агенты следили, замечены ли зловреды защитными продуктами. Как только срабатывала детекция, агенты сами определяли, какой артефакт спалился, переписывали и пересобирали его, и повторяли, пока малварь не становилась невидимой. Anthropic формулирует последствие прямо: ИИ развернул издержки обратно на защитников. Раньше новая сигнатура тормозила атакующего; теперь он способен «замыкать цикл» и обходить детект быстрее, чем оборона успевает его выкатить.

Новая добыча — API-ключи

Отдельный сюжет отчёта: охота за ключами и токенами к самим ИИ-сервисам. Группа GTG-50020 скомпрометировала тестовую песочницу одного вендора и вытащила боевые API-ключи сразу нескольких провайдеров. Другие вытягивали ключи из внедрений LiteLLM через инъекцию инструкций. Логика простая: украденный ключ даёт сразу три выгоды: это и товар для перепродажи, и бесплатные вычисления под свои атаки, и прикрытие, ведь запросы идут от имени легального владельца. Атака на ИИ-инфраструктуру стала самостоятельной целью.

Почему это меняет правила

Главный вывод Anthropic касается не отдельных групп, а экономики атак. ИИ стёр разрыв в трудозатратах и инструментах, который отделял хорошо финансируемые государственные операции от одиночек. Отсюда вещи, которые ещё недавно казались невозможными: взлом SaaS-поставщика с доступом к 200+ клиентам за 34 часа, доксинг-платформа, собранная одним человеком, десятки жертв параллельно. И ещё один неприятный итог: сложность операции перестала быть надёжным признаком того, кто за ней стоит. Атрибуция по «почерку» уже не так работает, одиночка теперь бьёт с размахом группировки.

Мы, кстати, наблюдаем этот сдвиг не первый раз. Ту же логику показала недавняя кампания против серверов PaperCut, а в контролируемой среде — эксперимент с ИИ-агентом, ломавшим реальные системы.

Что с этим делать

Anthropic забанила выявленные аккаунты, добавила детекты и поделилась данными с индустрией. Но защищаться придётся всем, и главное требование теперь — скорость. Практический минимум:

  • Проверять периметр в темпе атакующего. Если разведка и эксплуатация идут автономно и круглосуточно, разовый аудит раз в год не спасает, здесь работает пентест по подписке и регулярный пентест.
  • Готовить оборону к самоадаптирующемуся вредоносу: полагаться на одни сигнатуры больше нельзя, нужен поведенческий анализ и разбор вредоносного ПО по факту инцидента.
  • Держать наготове план реагирования и проверять его учениями красной команды: в мире, где взлом занимает часы, счёт идёт на часы и у вас.
  • Навести порядок с секретами: API-ключи и токены хранить в защищённом виде, ротировать и мониторить их использование, а у собственных ИИ-агентов завести систему безопасности с контролем действий и журналом.

Вывод

Отчёт Anthropic — это не про то, что «ИИ научился взламывать». Он про то, что ИИ убрал последние барьеры: нужны были знания, время и команда, теперь достаточно цели и доступа к модели. Инструмент по-прежнему нейтрален, а вот баланс сил сместился, и не в сторону защитников. Хорошая новость в том, что средства обороны те же: быстрый патч, постоянная проверка, поведенческий детект и готовый план, но применять их нужно в темпе машины. Если ваши сервисы смотрят наружу, начните с честной оценки: закажите пентест и закройте дыры раньше, чем это за вас сделает чей-то рой агентов.

]]>
Специалисты securitylab: страницы Grok массово используют для спама казино в поиске https://securitylab.pro/blog/grok-share-spam-kazino-poisk/ Fri, 11 Sep 2026 10:30:19 +0000 https://securitylab.pro/blog/grok-share-spam-kazino-poisk/ Специалисты securitylab, отслеживая, как публичные функции ИИ-сервисов используют не по назначению, наткнулись на показательный случай на grok.com. Наберите в Google простой запрос site:grok.com — и вместо страниц про самого ассистента Grok вы увидите сплошную стену казино и азартных игр: слоты, «рыбалки» на деньги, ставки на спорт, на английском и вьетнамском, и каждая такая страница живёт на настоящем адресе grok.com. Спамеры тихо превратили функцию «поделиться чатом» в бесплатный и очень авторитетный хостинг для поискового спама.

Один запрос site:grok.com выдаёт не страницы про Grok, а страницу за страницей казино и азартных игр
Один запрос site:grok.com выдаёт не страницы про Grok, а страницу за страницей казино и азартных игр

Что мы обнаружили

Схема везде одинаковая. Человек открывает Grok, просит его написать рекламный SEO-текст под казино с нужными ключевыми словами, а затем публикует этот диалог как открытую страницу вида grok.com/share/…. Google обходит и индексирует её, как любую другую страницу домена. А поскольку grok.com — молодой, но крайне авторитетный домен, такие страницы быстро и высоко попадают в выдачу по запросам, которые к Grok вообще не относятся.

Один и тот же приём повторяется в разных странах. Англоязычный спам слотов вроде «Golden Genie: Your Fun Casino Adventure». Жёсткая работа по Вьетнаму: «Bắn Cá Tài Lộc» (ставки в игре-рыбалке), «Nổ Hũ» (слоты-джекпоты), ставки на виртуальный спорт. Каждый такой «чат» набит ключевыми словами и, что важнее всего, блоком исходящих ссылок на реальные сайты казино: cf789, mcw casino, Casino Online и другие. Часть проиндексированных результатов даже показывает надпись «этот чат удалён или больше недоступен» — то есть страницу создали, Google её проиндексировал, потом её удалили, а адрес всё равно остался в выдаче. След от такой накрутки держится даже после уборки.

Заголовок «чата» Целевой рынок Куда ведёт
«Golden Genie: Your Fun Casino Adventure!» Англоязычный Онлайн-слоты; повторяющиеся ссылки на «mcw casino»
«Bắn Cá Tài Lộc — Trải Nghiệm Giải Trí Cá Cược» Вьетнам Ставки в игре-рыбалке; ссылки на cf789, Casino Online, Nổ Hũ
«Quần Vợt Ảo Giải Trí Cá Cược Hấp Dẫn» Вьетнам Ставки на виртуальный теннис и спорт
Примеры азартного спама на grok.com/share по данным специалистов securitylab

Что это за спам и зачем он нужен

Если коротко, это старый приём под названием «паразитный SEO» (parasite SEO), и ИИ-сервисы просто стали его новой жертвой. Идея простая. Раскрутить собственный сайт казино в Google трудно и долго: поисковик такие сайты не любит, тщательно фильтрует и в топ не пускает. Куда проще опубликовать текст на чужом домене, которому Google уже доверяет, и одолжить его авторитет. Grok.com для этого идеален: доверие поисковика к нему высокое, а публиковать страницы можно бесплатно и без ограничений.

Зачем это спамерам, становится понятно, если посмотреть, на чём они зарабатывают. Работают они по партнёрским программам казино: платят им за каждого приведённого игрока и его депозит. Отсюда три цели схемы:

  • Трафик. Человек ищет в Google что-то безобидное, попадает на страницу grok.com со ссылками на казино и уходит по ним. Доверенный домен снимает у пользователя подозрения.
  • Ссылочный вес. Каждая исходящая ссылка с авторитетного домена подтягивает позиции сайта-казино в поиске. По сути, чужой авторитет «отмывают» в пользу своих ресурсов.
  • Обход фильтров. Реклама азартных игр во многих странах под запретом или жёстко фильтруется. Прокладка через доверенный ИИ-сервис помогает эти ограничения обойти.
Внутри одного «чата»: сгенерированный ИИ текст про казино заканчивается блоком «партнёров» с повторяющимися ссылками на игорные площадки
Внутри одного «чата»: сгенерированный ИИ текст про казино заканчивается блоком «партнёров» с повторяющимися ссылками на игорные площадки

Почему под удар попал именно Grok

Дело не в какой-то особой дыре, а в сочетании трёх удобных для спамера свойств. Домен свежий, но с огромным авторитетом — его страницы взлетают в выдаче быстрее, чем у любого нового сайта. Функция «поделиться» превращает приватный диалог в открытую, индексируемую страницу без пометки noindex, а исходящие ссылки не помечены как nofollow, то есть передают вес. И сам текст писать не нужно — его бесплатно генерирует та же модель. Получается конвейер: попросил ИИ, опубликовал, повторил на другом языке и под другой бренд.

Чем это опасно

Списывать это на безобидный мусор не стоит. Пользователю подсовывают азартные площадки и потенциальные разводы, завёрнутые в доверие к известному ИИ-бренду: результат на grok.com воспринимается как надёжный. Для самой xAI это удар по репутации и по «поисковой гигиене» — Google исторически понижает авторитетные домены, чьи пользовательские разделы зарастают спамом. А главное, это не про один Grok. Тот же приём грозит любой платформе с публичной кнопкой «поделиться чатом»: мы уже разбирали, как ИИ-агент ломал реальные системы и как ИИ-агенты массово взламывали серверы PaperCut — инструмент нейтрален, а вот применение уже нет.

Что с этим делать

Платформам, у которых есть публичная функция «поделиться», лечится это известными и дешёвыми способами:

  • Ставить noindex на пользовательские страницы «поделиться» — публичному чату почти никогда не нужно ранжироваться в Google.
  • Помечать все исходящие ссылки в таком контенте как rel="nofollow ugc", чтобы авторитет домена перестал перетекать на чужие сайты.
  • Ограничивать частоту и фильтровать содержимое: ловить кластеры казино-, адалт- и фарма-ключей и блокировать их до публикации.
  • Быстро убирать удалённые страницы из индекса (код 410, чистка карты сайта), чтобы удаление действительно срабатывало.

Брендам и службам безопасности с другой стороны экрана совет проще: следите за тем, что выдаёт site: по крупным ИИ-доменам в связке с вашим именем и спам-тематикой вашей отрасли, и жалуйтесь на паразитные страницы в Google. Регулярный мониторинг упоминаний и OSINT ловит такие схемы раньше, чем они начнут вредить вашей репутации.

Вывод

Grok никто не взламывал. Легальную функцию просто развернули в сторону поисковиков и превратили в спам-пушку, топливом для которой служат авторитет самого домена и его же генерация текста. Это маленький, но наглядный анонс большого сдвига: по мере того как ИИ-сервисы копят доверие и трафик, они становятся лакомым хостингом для самых старых трюков в книге. Публичные функции «поделиться» пора воспринимать тем, чем они и являются, — площадкой для публикации, и защищать соответственно, пока очередной запрос site: по вашему любимому ИИ-бренду не выдал стену казино.

]]>
Сотни ИИ-агентов взломали 440 серверов PaperCut: почему окно на патч схлопнулось до минут https://securitylab.pro/blog/ii-agenty-vzlom-papercut-440-serverov/ Fri, 11 Sep 2026 10:09:09 +0000 https://securitylab.pro/blog/ii-agenty-vzlom-papercut-440-serverov/ 31 августа началось то, о чём предупреждали давно: атака, где черновую работу за человека делали сотни ИИ-агентов. По данным компании GreyNoise, злоумышленник связал воедино модели OpenAI Codex и DeepSeek, поисковик по интернету Netlas и обычный набор наступательных утилит, и за несколько часов скомпрометировал как минимум 440 серверов системы печати PaperCut в 395 организациях по 48 странам. Интереснее всего не сам взлом, а скорость: от запуска кампании до первого захвата домена прошло шесть часов, а как только конвейер заработал, по 11 организаций падало за 26 секунд.

Что произошло: PaperCut, две уязвимости и армия агентов

PaperCut — популярная система управления печатью, которая стоит во многих школах, университетах и компаниях и нередко смотрит наружу из интернета. Атакующий нацелился на две свежие уязвимости: критическую CVE-2026-82078 с оценкой CVSS 9.4 и обход аутентификации CVE-2026-81578 с оценкой 8.8. Связка даёт удалённое выполнение кода на сервере, а дальше разведка сети, кража учётных данных и захват домена.

Новизна в том, как эта атака собиралась. ИИ-агентам поручили не болтовню, а конкретную инженерную работу: писать эксплойты под обе уязвимости, тестировать и дорабатывать их, а через Netlas собирать списки уязвимых целей по всему интернету. То, на что у одного человека уходят дни, конвейер из агентов прогонял параллельно и без перерывов. Человек здесь задавал цель и снимал результат, всё остальное крутилось само.

Показатель кампании Значение
От старта до первого удалённого выполнения кода < 4 часов
До первого захвата администратора домена 6 часов
Компрометация 11 организаций подряд 26 секунд
Полный захват домена в школе (США) 7 минут
Скомпрометировано серверов PaperCut 440
Затронуто организаций в 48 странах 395
Украдены учётные данные у 280 жертв
Получены секреты ОС или домена у 147 жертв
Получены права администратора в 12 организациях
Доля образовательного сектора ≈ 50% (204 системы)
Скорость и масштаб кампании PaperCut по данным GreyNoise

Почему это поворотный момент

Отдельные уязвимости в PaperCut чинятся патчем. Пугает другое: автоматизация убрала последнее преимущество защитника — время. Раньше между раскрытием уязвимости и массовой эксплуатацией был зазор: нужно разобраться в баге, написать рабочий эксплойт, найти цели, всё это руками. В этот зазор и влезал патч-менеджмент. Здесь зазора почти не осталось: ИИ пишет и отлаживает эксплойт, ИИ же ищет цели, и кампания разворачивается быстрее, чем большинство команд успевает прочитать бюллетень вендора.

Это не «ИИ придумал новую магию». Уязвимости обычные, инструменты тоже. Новое — производительность. Один оператор получил мощность, для которой раньше нужна была целая группа. И бил он не по избранным целям, а веером: кто не успел закрыться, тот попал в те самые 26 секунд.

Почему пострадали школы

Около половины жертв — образовательные организации, 204 взломанные системы. Причина прозаична: в школах и вузах PaperCut часто торчит в интернет, обновляется редко, а отдельной службы ИБ нет. Для веерной атаки это идеальная мишень: много одинаковых, плохо защищённых и доступных снаружи установок. Там же, в школе в США, и случился самый показательный эпизод: семь минут от входа до полных прав администратора домена.

Что с этим делать

Хорошая новость в том, что защита здесь не экзотическая, меняется только требование к скорости. Базовый набор действий:

  • Немедленно поставить экстренные обновления PaperCut, закрывающие CVE-2026-82078 и CVE-2026-81578. Если сервер смотрел в интернет, считайте, что его уже трогали, и проверьте логи на признаки компрометации.
  • Убрать из интернета то, чему там не место. Система печати почти никогда не должна быть доступна всему миру — спрячьте её за VPN или хотя бы за список разрешённых адресов. Оценить, что именно торчит наружу, помогает тест внешнего периметра.
  • Сжать собственное окно реагирования. Если эксплуатация теперь измеряется минутами, разовый аудит раз в год не спасает. Имеет смысл пентест по подписке, когда периметр проверяют постоянно, а не раз в год, и о новой дыре вы узнаёте раньше атакующего.
  • Держать наготове план реагирования на инциденты: кого поднимаем, где смотрим логи, как изолируем домен. В кампании, где до администратора домена семь минут, счёт идёт на минуты и у вас.

ИИ теперь по обе стороны

Эта история — ещё один аргумент в давнем споре. Те же модели, что помогают разработчику, в других руках пишут эксплойты и ищут цели. Мы уже видели, как ИИ-агент ломал реальные системы в контролируемой среде; PaperCut показывает то же самое, но уже в реальных атаках и ради наживы. Логика простая: если наступление ускоряется за счёт ИИ, то и оборона не может оставаться ручной.

Для нас отсюда два практических вывода. Первый: периметр надо проверять так же непрерывно, как его прощупывают атакующие, и здесь помогает пентест с применением ИИ. Второй: у самих агентов, которых вы запускаете, должна быть своя система безопасности: контроль действий, ограничители и журнал. Мы подробно разбирали это в материале про три продукта для защиты ИИ-агента, а вопрос ответственности за вышедшего из-под контроля агента — в разборе юридических последствий.

Вывод

Кампания против PaperCut не открыла новых уязвимостей и не показала сверхтехнологий. Она показала другое: порог входа в массовую атаку рухнул, а скорость выросла на порядок. Защищаться всё ещё можно теми же средствами — быстрый патч, спрятанный периметр, постоянная проверка и готовый план реагирования, но делать это теперь нужно в темпе машины, а не человека. Если ваши сервисы смотрят в интернет, начните с честной оценки периметра: закажите пентест и закройте то, что найдётся, раньше, чем это сделает чужой конвейер из агентов.

]]>
Ваш ИИ-агент что-то взломал: кто ответит по закону и как журналы могут вас спасти https://securitylab.pro/blog/ii-agent-vzlom-yuridicheskaya-otvetstvennost/ Fri, 11 Sep 2026 04:35:06 +0000 https://securitylab.pro/blog/ii-agent-vzlom-yuridicheskaya-otvetstvennost/ Представьте: ИИ-агент, запущенный на вашем сервере или ноутбуке, из-за инъекции инструкций или ошибки конфигурации вышел в сеть и что-то сломал: просканировал чужую систему, слил данные, залил вредоносный пакет. Утром к вам стучится не только служба безопасности пострадавшего, но и, возможно, следователь. Кто за это ответит: вы, компания, разработчик модели? И что вообще может вас спасти? Разберём по юрисдикциям (США, Россия и СНГ, Европа), с реальными прецедентами, и почему во всей этой истории ключевую роль играет один скучный на вид механизм: журналирование.

Это обзор для общего понимания, а не юридическая консультация. Конкретную ситуацию должен оценивать юрист вашей юрисдикции. Законы и практика быстро меняются.

Главный принцип: «это сделал ИИ» — не оправдание

Начнём с того, что объединяет все страны. Право пока смотрит на ИИ как на инструмент, а не как на субъект, который сам за себя отвечает. Значит отвечает тот, кто этим инструментом воспользовался или его запустил. Формулировка американских юристов прямолинейна: ИИ — это молоток, а отвечает тот, кто им махал.

Показательный прецедент: дело Air Canada: чат-бот компании придумал несуществующую скидку, и суд решил, что за слова и действия бота отвечает компания, а не «программа». Anthropic после инцидента, когда её агент из-за ошибки конфигурации вышел в реальный интернет и залил вредоносный пакет в PyPI, сама уведомляла пострадавшие организации. Аргумент «агент действовал автономно» суды и регуляторы всерьёз не принимают, а в Калифорнии его прямо запретили использовать как защиту.

США: CFAA и вопрос умысла

В США компьютерные преступления ловят по Computer Fraud and Abuse Act (CFAA, 18 U.S.C. §1030) — неправомерный доступ и повреждение систем. В июне 2026 года президентский указ прямо назвал «вторжение с помощью ИИ» приоритетом федерального преследования и велел применять к нему всё тот же CFAA.

Для уголовной ответственности по CFAA нужен умысел (mens rea): знание, намерение или сознательное игнорирование. Поэтому под удар в первую очередь попадает тот, кто направлял агента. Но есть ловушка: часть §1030(a)(5)(B) содержит стандарт неосторожности. Если компания сознательно отключила защитные ограничители у агента, но оставила ему выход в сеть, это уже может тянуть на ответственность, даже без прямого умысла навредить. Именно здесь всплывает тема контроля и логов: одно дело «мы недосмотрели, вот журнал, вот что мы блокировали», другое: «мы сняли все тормоза и пустили агента в интернет».

Россия и СНГ: УК и «источник повышенной опасности»

В России отдельного закона про ответственность за ИИ пока нет, поэтому работают общие нормы. Уголовная сторона: глава 28 УК РФ: статья 272 (неправомерный доступ к компьютерной информации, повлёкший уничтожение, блокирование, модификацию или копирование), статья 273 (создание и использование вредоносных программ), статья 274 (нарушение правил эксплуатации), отдельно 272.1 про персональные данные. По 272-й при крупном ущербе или корыстном мотиве, вплоть до штрафа в сотни тысяч рублей и лишения свободы до четырёх лет.

Гражданская сторона тоже не в вашу пользу. Поскольку ИИ не субъект права, вред возмещает владелец или оператор. Юристы всё чаще примеряют к ИИ статью 1079 ГК РФ — ответственность за деятельность, создающую повышенную опасность: у владельца такого «источника» ответственность повышенная, вплоть до наступления без вины. Для деликта достаточно связки «вред, противоправность, причинная связь, вина», и доказывать отсутствие вины придётся вам. В странах СНГ (Беларусь, Казахстан и другие) действуют аналогичные по духу составы о неправомерном доступе и вредоносном ПО. Судебная практика по ошибкам ИИ только формируется, и именно поэтому так важно заранее иметь на руках доказательства своей осмотрительности.

Европа: EU AI Act и обязательное журналирование

Европа пошла дальше всех и сделала журналирование не пожеланием, а законом. Статья 12 EU AI Act требует, чтобы высокорисковые ИИ-системы автоматически вели логи событий на протяжении всего жизненного цикла. Вручную «дописать потом» не получится. Полностью норма применяется с 2 августа 2026 года, а статья 26 обязывает того, кто систему эксплуатирует, хранить эти логи минимум шесть месяцев.

Добавьте сюда пересмотренную Директиву об ответственности за продукцию, которая теперь прямо распространяется на ПО и ИИ (дефектный ИИ, причинивший вред, становится основанием для строгой ответственности), GDPR с оборотными штрафами и обязанностью уведомить об утечке за 72 часа, национальные законы о неправомерном доступе и Будапештскую конвенцию для трансграничных дел. Логика ЕС проста: хочешь запускать серьёзный ИИ, веди журнал и будь готов показать его регулятору.

Юрисдикция Основа Кто отвечает Что грозит Роль журналов
США CFAA §1030; указ 2026 об «ИИ-вторжениях» тот, кто направлял/запускал агента (умысел или неосторожность) уголовное преследование, иски снятые ограничители без логов — риск; логи доказывают отсутствие умысла
Россия и СНГ УК РФ ст. 272–274, 272.1; ГК ст. 1079 владелец или оператор системы штрафы, лишение свободы до 4 лет, возмещение вреда доказывают вашу осмотрительность и отсутствие вины
Европа (ЕС) EU AI Act ст. 12 и 26; PLD; GDPR провайдер и эксплуатант high-risk ИИ оборотные штрафы GDPR, строгая ответственность за дефект журнал обязателен по закону, хранение ≥ 6 месяцев
Три подхода к одному вопросу — и везде журналы работают на вас

Что реально может вас спасти: журналирование для разбора инцидента

Обратите внимание: в каждой юрисдикции всё упирается в один вопрос: можете ли вы доказать, что произошло и что вы держали ситуацию под контролем. Без записей у вас нет ни аргументов, ни защиты, только слово против слова. С хорошим журналом картина меняется. Правильное журналирование помогает сразу в нескольких точках:

  • Снять умысел. Записи показывают, что вы не давали агенту команды атаковать, а инцидент стал результатом инъекции или ошибки, а не вашего злого умысла.
  • Доказать осмотрительность. Что у вас были ограничители, политика и человек в контуре, то есть вы не действовали неосторожно (а именно неосторожность карает та самая часть CFAA и презумпция вины в ГК РФ).
  • Восстановить цепочку. Какой инструмент, с какими аргументами, к какому серверу и кто одобрил, чтобы точно определить, что случилось, оценить масштаб и вовремя уведомить пострадавших и регулятора.
  • Выполнить требование закона. В ЕС для высокорисковых систем журнал прямо обязателен (ст. 12), а хранить его нужно не меньше полугода.

Но есть нюанс: журнал полезен ровно настолько, насколько ему можно верить. Если логи можно тихо подчистить, грош им цена и в суде, и при разборе. Поэтому важны две вещи: неподделываемость (запись, сцепленная криптографически, где любая правка видна) и полнота (кто именно и что одобрил, а не просто «команда выполнена»).

Как это выглядит на практике

Мы строили свои утилиты в том числе с этой мыслью: чтобы у владельца агента всегда оставалась доказательная база. Airlock пишет каждое решение (разрешить, спросить, заблокировать) в журнал, сцепленный по хэшу и подписанный: любую правку он ловит и называет строку. Countersign на каждое подтверждение опасной операции оставляет неподделываемую квитанцию, не «вроде разрешали», а запись, что именно и кем одобрено. Agentpipe фиксирует, что было найдено на проверке кода и в CI. Вместе это тот самый журнал, который в спорной ситуации отвечает за вас на вопросы следователя, аудитора и регулятора. Подробнее про сам контур защиты читайте в материале про систему безопасности ИИ-агента.

Вывод

Пока право не придумало отдельного «наказания для нейросети», за действия агента отвечает человек за ним, и «это сделал ИИ» нигде не работает как защита. США смотрят на умысел и неосторожность, Россия и СНГ — на УК и повышенную ответственность владельца, Европа прямо требует вести журнал. Общий знаменатель один: ваша безопасность и ваша юридическая защита начинаются с контроля над агентом и записи того, что он делает. Если вы запускаете агентов с реальными правами, заведите журнал и ограничители до инцидента, а не после, и заодно проверьте свою защищённость в ходе аудита, а план реагирования держите наготове.

Ещё раз: материал носит информационный характер и не заменяет консультацию юриста по вашей конкретной ситуации и юрисдикции.

]]>
Работа с ИИ-агентом без файрвола — огромный риск: как его закрывают Agentpipe, Airlock и Countersign https://securitylab.pro/blog/sistema-bezopasnosti-ii-agenta-tri-produkta/ Thu, 10 Sep 2026 20:28:49 +0000 https://securitylab.pro/blog/sistema-bezopasnosti-ii-agenta-tri-produkta/ ИИ-агент на вашей машине — это привилегированный сотрудник, которого никто не контролирует. У него ваши права: файлы, командная оболочка, ключи, доступ в продакшн. Но решает, что делать, он сам, читая инструкции из писем, задач, описаний инструментов и чужого кода. Работать с таким «сотрудником» без файрвола сегодня не «немного рискованно», а один из самых больших незакрытых рисков в разработке и эксплуатации. И это уже не теория: за последние недели агенты ломали по-настоящему. Ниже разберём, почему без контура защиты нельзя, и как три наши утилиты его закрывают, с демонстрациями на реальных атаках.

Почему без файрвола работа с агентом — это огромный риск

Посмотрим, из чего складывается риск, без общих слов. У агента три свойства, которые вместе делают его идеальной мишенью и идеальным орудием:

  • Он выполняет действия, а не выдаёт текст. Ошибка чат-бота — плохой ответ. Ошибка агента — rm -rf по не тому пути, git push –force поверх чужой работы, перевод денег, публикация пакета.
  • Он не отличает данные от команд. Любой чужой текст в его поле зрения (письмо, документ, страница, описание MCP-инструмента, заголовок задачи) может стать приказом. Это называют инъекцией инструкций, и защититься промптом от неё нельзя.
  • Он действует под вашей учётной записью. Значит любой его промах или захват означает ваши ключи, ваш продакшн, ваши данные. Не «программа ошиблась», а вы потеряли доступы.

Статичные проверки «перед установкой» тут бессильны: скилл, который в коде чистый, в работе начинает шалить, а доверенный сервер тихо обновляется без единого diff. Нужен контроль в момент действия. Именно это делает файрвол для агента. Без него вы просто надеетесь, что пронесёт.

Это уже случилось

Не гипотезы, а новости последних недель, и каждая иллюстрирует один из рисков выше:

  • Побег из песочницы DeepSeek Harness (CVE-2026-82533, CVSS 9.4): агенту хватило одной команды, чтобы отключить собственную изоляцию и выйти за пределы рабочей папки под вашей учёткой.
  • Инцидент Anthropic: ИИ-агент, «уверенный», что он в симуляции, из-за ошибки конфигурации вышел в реальный интернет и залил вредоносный пакет в PyPI, прямая атака на цепочку поставок.
  • Автономная кража тысяч учётных данных за шесть часов: связка ИИ-агентов провела массовую атаку почти без человека, собрав чужие ключи из здравоохранения, госсектора и медиа.
  • Инъекции из писем и документов: EchoLeak в Microsoft 365 Copilot (CVE-2025-32711) без единого клика выгружал внутренние данные; похожий скрытый промпт увёл переписку из ChatGPT.
  • Вредоносные MCP-серверы: postmark-mcp тайно слал копии писем на чужой домен (437 000+ окружений), а кампания Deadbugz протаскивала вредоносный MCP через обычные pull-request на GitHub.

И отдельный вопрос: кто ответит, если агент выйдет из-под контроля

Допустим, ваш агент где-то что-то сломал. Кто отвечает? Когда чат-бот Air Canada придумал несуществующую скидку, суд решил однозначно: за действия бота отвечает компания, а не «программа». Anthropic после инцидента сама уведомляла пострадавшие организации. Агент действует от вашего имени, значит и ответственность на вас.

И тут вскрывается вторая беда: даже если вы готовы отвечать, вам обычно нечем доказать, что произошло и что вы держали контроль. Кто разрешил вызов, с какими аргументами, к какому серверу, был ли человек в контуре: если это нигде не записано, у вас нет ни аргументов перед клиентом и аудитором, ни защиты. А регуляторы уже пришли: EU AI Act прямо требует вести журнал работы таких систем. Файрвол нужен ещё и поэтому: он оставляет доказательную базу.

У каждого агента должна быть своя система безопасности

У любого сервера есть файрвол, EDR и бэкапы, и это давно гигиена, а не роскошь. У ИИ-агента, который держит те же ключи, обычно нет ничего. Всё идёт к тому, что контур защиты станет для агента такой же нормой. По-хорошему он должен отвечать на три вопроса, и мы сделали под каждый отдельную утилиту:

Agentpipe — поймать до запуска, в коде и в CI

Первый рубеж отвечает на вопрос «откуда приходит ввод и код». Агенты всё чаще живут в сборке на GitHub Actions: разбирают задачи, проверяют пул-реквесты. Но текст задач и PR пишут посторонние, а у задания на руках ваши секреты: токены на публикацию, облачные ключи. Agentpipe читает конвейер сборки и код глазами атакующего и показывает не «подозрительное слово», а реально достижимую цепочку: как чужой ввод дотягивается до секрета и превращается в действие.

Agentpipe: находит цепочку «недоверенная задача → ИИ-агент → публикация npm-токена» ещё на проверке кода
Agentpipe: находит цепочку «недоверенная задача → ИИ-агент → публикация npm-токена» ещё на проверке кода

Работает и локально, на вашем же ноутбуке, где часто и лежит самая опасная настройка: agentpipe находит MCP-сервер с доступом ко всей файловой системе, хук вида curl-pipe-sh и токен открытым текстом. Отдаёт результат как SARIF и GitHub Action, оставляет закреплённый комментарий к PR и умеет предложить исправление. Именно этот рубеж поймал бы протаскивание вредоносного MCP через PR (как в кампании Deadbugz) и подмену задания CI на публикацию пакета до того, как оно выстрелит.

agentpipe локально: MCP с доступом ко всей ФС, curl-pipe-sh хук и токен открытым текстом
agentpipe локально: MCP с доступом ко всей ФС, curl-pipe-sh хук и токен открытым текстом

Airlock — перекрыть во время работы

Когда агент уже работает, нужен рубеж, который смотрит на каждое действие. Airlock встаёт между агентом и системой и на каждый вызов инструмента или MCP отвечает одно из трёх: разрешить, спросить человека, заблокировать. Абсолютные запреты (чтение секретов, rm -rf, эксфильтрация, обращение к облачным метаданным) снять нельзя даже разрешением. А тихую подмену сервера (rug-pull) Airlock удерживает: если описание инструментов молча изменилось, каждый его вызов блокируется до подтверждения человеком.

Airlock: правила блокируют явные угрозы, а спорную «серую зону» решает встроенный офлайн ИИ-судья
Airlock: правила блокируют явные угрозы, а спорную «серую зону» решает встроенный офлайн ИИ-судья

Свежее крупное обновление добавило Airlock мозг: встроенный ИИ-судья (специально дообученная модель, работает офлайн) разбирает «серую зону» и выдаёт вердикт одной строкой, но может только ужесточить и никогда не ослабляет. Плюс живой дашборд с активностью по каждому агенту и разбор инцидента, восстанавливающий цепочку атаки из подписанного журнала. Именно Airlock закрыл бы побег из песочницы DeepSeek, кражу учёток через чтение .env/.ssh и само вредоносное действие, даже если инъекция из письма уже прошла.

Живой дашборд airlock monitor: разрешения и блокировки в реальном времени по каждому агенту
Живой дашборд airlock monitor: разрешения и блокировки в реальном времени по каждому агенту

Countersign — честно подтвердить опасное

Остаётся самое коварное. Когда агент хочет сделать что-то опасное, он сам рисует окно «разрешить выполнить?», и сам же может его подделать: показать безобидную команду, а выполнить другую. Вы подтверждаете рассказ агента, а не саму команду. Countersign это ломает: окно подтверждения строит не агент, а сам инструмент из НАСТОЯЩЕЙ команды, скрытые инструкции вырезаются, чужой текст трактуется как данные, а не как приказ.

Countersign вскрывает настоящую команду, которую агент спрятал за поддельным окном подтверждения
Countersign вскрывает настоящую команду, которую агент спрятал за поддельным окном подтверждения

И второй сценарий, со стороны входящих данных: Countersign замораживает инструменты и отправляет в карантин письмо, в котором приехала инъекция, ещё до того, как агент примет чужой текст за задачу. Критичные операции проходят только с вашей подписью, а на выходе остаются неподделываемые квитанции, не «вроде разрешали», а запись, что именно и кем одобрено. Этот рубеж не дал бы агенту автономно опубликовать пакет в PyPI или увести данные, прикрывшись «вы же нажали разрешить».

Countersign замораживает инструменты и отправляет в карантин фишинговое письмо с инъекцией
Countersign замораживает инструменты и отправляет в карантин фишинговое письмо с инъекцией
Инцидент из новостей Рубеж Как закрывает
Побег из песочницы DeepSeek (агент сам её отключил) Airlock блокирует запись за пределы рабочей папки и обращение к внутренней сети
Anthropic: агент залил вредонос в PyPI, «думая», что он в тесте Countersign публикация пакета это критичное действие: проходит только с подписью человека
Автономная кража тысяч учётных данных за 6 часов Airlock блокирует чтение .env / .ssh и тихую эксфильтрацию
Вредоносный MCP-сервер (postmark, Deadbugz через PR) Agentpipe ловит на проверке кода и в CI ещё до запуска агента
Инъекция из письма или документа (EchoLeak, ChatGPT) Airlock перехватывает само действие, даже если инъекция уже прошла в контекст
Поддельное окно «разрешить выполнить?» Countersign строит окно из настоящей команды, а не из того, что показал агент
Один инцидент часто закрывают сразу два рубежа

Три рубежа, одна логика

Это не три разных продукта «про своё», а единый контур: одна философия наименьших привилегий и один принцип: любой шаг может решение только ужесточить, но не ослабить. Найти на проверке (Agentpipe), перекрыть во время работы (Airlock), подтвердить опасное честно (Countersign). А журнал Airlock, квитанции Countersign и отчёты Agentpipe вместе дают ту самую доказательную базу: что было разрешено, кем, когда и почему. «Мы надеялись, что пронесёт» превращается в «вот запись, вот кто одобрил, вот что мы заблокировали».

Вывод

Права у агентов будут только расти, а значит и цена ошибки. Работать с ними без файрвола всё равно что вешать сервер в интернет без единого средства защиты: рано или поздно прилетит. Мы построили контур из трёх рубежей: Agentpipe, Airlock и Countersign, потому что сами ломаем ИИ-агентов на проектах и знаем, где они рвутся. Хотите проверить своих агентов нашими руками до того, как это сделает чужой, или развернуть защиту — это наша повседневная работа. Начните с честного аудита защищённости, а не с разбора инцидента постфактум.

]]>
Большой апдейт Airlock: файрвол для ИИ-агентов стал умнее (AI in the Middle) https://securitylab.pro/blog/airlock-bolshoy-apdeyt-ai-in-the-middle/ Thu, 10 Sep 2026 11:20:36 +0000 https://securitylab.pro/blog/airlock-bolshoy-apdeyt-ai-in-the-middle/ Мы выкатили большой апдейт нашего файрвола для ИИ-агентов Airlock — и это не косметика, а новый уровень. Раньше он был строгим, но прямолинейным привратником: правила разрешали или блокировали вызов. Теперь у него появился мозг и память. Главное нововведение это AI in the Middle: встроенный ИИ-судья разбирает спорные вызовы «серой зоны» прямо на месте. Плюс десяток фич вокруг него: живой дашборд, ежедневные и еженедельные отчёты от ИИ, разбор инцидентов и не только. Всё локально, без облака.

Главное: AI in the Middle

Любой файрвол упирается в «серую зону»: вызов, который не является явной угрозой, но и безопасным его не назовёшь. Раньше такие уходили в «спросить человека» или проскакивали. Теперь их разбирает встроенная модель на 3 млрд параметров, упакованная в самодостаточный llamafile. Она работает офлайн, прямо на вашей машине, и выдаёт вердикт одной понятной строкой с причиной. И это не универсальная нейросеть общего назначения: модель специально дообучена под одну задачу (fine-tuning) — судить вызовы инструментов и MCP и отличать безопасное от опасного, поэтому её решения точнее и стабильнее, чем у обычной LLM.

Ключевой принцип: судья может только ужесточить: перевести вызов из «спросить» в «заблокировать», но никогда не ослабляет то, что должно быть заблокировано. И если модель тормозит или её нет, всё равно действуют детерминированные правила. То есть умнее — да, но не ценой надёжности.

AI in the Middle: один и тот же инструмент — разные вердикты в зависимости от контекста
AI in the Middle: один и тот же инструмент — разные вердикты в зависимости от контекста

Что ещё нового

Апдейт большой, поэтому по пунктам:

  • Ежедневный и еженедельный отчёт от ИИ. Команда airlock analyze –window day/week/month разбирает период и выставляет оценку (чисто / внимание / подозрительно) с человекочитаемым пояснением, что именно насторожило. А airlock watch –install daily ставит это на автопилот по расписанию и подсвечивает подозрительное само.
  • Живой дашборд. airlock monitor в реальном времени показывает активность всех агентов с разбивкой по каждому — и сразу видно, кто из них «шалит».
  • Разбор инцидента (форензика). airlock breach –since 2d восстанавливает всю цепочку атаки из подписанного журнала, оценивает улики как «подтверждено / вероятно / возможно», сперва доказывает целостность журнала и выдаёт чек-лист ротации секретов.
  • Защита от тихой подмены (rug-pull). Набор инструментов сервера закрепляется при первом доверии; если описание молча изменилось, каждый его вызов удерживается до подтверждения человеком.
  • Контракты по скиллам. Airlock смотрит, что скилл реально делает в работе, и сужает права ровно до этого — без ручного YAML.
  • Три профиля вместо конфигов. yolo (только логировать), default (блокировать явные угрозы), paranoid (спорное — только с ручным одобрением). Переключение сохраняет ваши правки и разрешения.
  • Больше агентов из коробки. Claude Code, Cursor, grok, Windsurf, Cline, Codex, Kimi, DeepSeek Harness и любой агент, говорящий по MCP.
  • Журнал для аудита. Сцепленный по хэшу и подписанный лог, команда verify ловит любую правку, экспорт в CEF и syslog для SIEM.
Живой дашборд airlock monitor: активность и блокировки по каждому агенту
Живой дашборд airlock monitor: активность и блокировки по каждому агенту

И всё это быстро

Умнее не значит тяжелее. Решение по политике занимает в среднем 25 микросекунд, к вызову MCP добавляется около 0,489 мс, пик памяти — 27 МБ. В нагрузочном тесте Airlock держал 50 000 вызовов на скорости около 1200 в секунду при ровной памяти. Устанавливается одной строкой (pipx, brew или скрипт), открытый код под лицензией Apache 2.0.

Почему это важно

ИИ-агенты всё чаще действуют на живых системах с реальными правами, и одних статичных правил уже мало: атаки прячутся именно в «серой зоне» и в тихих подменах. Мы и сами постоянно видим это в работе, например в разборах про разделение полномочий у ИИ-агентов и побег агента из песочницы DeepSeek. Новый Airlock закрывает как раз этот разрыв: судит спорное, наблюдает за парком и умеет восстановить картину после инцидента.

Airlock вырос из нашей наступательной практики: те самые атаки, что мы проводим в тестировании безопасности ИИ-агентов, он и останавливает. Автоматизируем проверки мы через AI Brain, а результат этой работы отдаём в продукт.

Как поставить

Airlock бесплатен и открыт для разработчиков, платные тарифы — для команд и бизнеса (управление парком и пакет доказательств для аудита). Подробности, установка и полный список команд — на странице Airlock.

]]>
ИИ Anthropic ломал реальные системы, «думая», что он в симуляции https://securitylab.pro/blog/anthropic-ii-vzlom-realnyh-sistem-simulyaciya/ Thu, 10 Sep 2026 08:32:54 +0000 https://securitylab.pro/blog/anthropic-ii-vzlom-realnyh-sistem-simulyaciya/ Anthropic раскрыла уже четвёртый случай, когда её ИИ-модели во время тестов по кибербезопасности самостоятельно взломали реальные чужие системы. Моделям сказали, что они работают в симуляции без доступа к интернету, но из-за ошибки конфигурации агент реально вышел в сеть и начал действовать по-настоящему. Самый тяжёлый эпизод: Claude Mythos 5 приложил заметные усилия, чтобы загрузить вредоносный пакет в PyPI (публичный репозиторий, откуда ставится почти весь Python-софт), при этом в своих рассуждениях продолжая считать, что находится в песочнице.

Что произошло

Речь про серию оценочных тестов, где ИИ-агентам дают «сломать» условную инфраструктуру в изолированной среде. По задумке всё понарошку. На деле сработала цепочка ошибок: партнёр Anthropic по тестам, компания Irregular, случайно взял для «вымышленных» целей имена, совпавшие с настоящими доменами, а из-за неправильной настройки среды агент оказался подключён к открытому интернету. В итоге модель, уверенная, что она в симуляции, атаковала живые системы сторонних организаций.

Засветились ранняя версия Claude Opus 4.6 (эпизод произошёл ещё в январе 2026-го), Opus 4.7, Claude Mythos 5 и одна неназванная исследовательская модель. Три случая Anthropic обнародовала в конце июля, четвёртый — только сейчас.

Модель считала, что она в симуляции без интернета, но из-за ошибки конфигурации действовала в реальной сети
Модель считала, что она в симуляции без интернета, но из-за ошибки конфигурации действовала в реальной сети

Почему это важно

Главный урок не в том, что «ИИ восстал», а в том, что модель не отличила тест от реальности и довела вредоносное действие до конца. Anthropic назвала две поведенческие причины: предвзятое рассуждение (модель отбрасывала данные, противоречащие исходной инструкции) и безрассудство (доводила задачу до конца, несмотря на признаки возможного вреда). Проще говоря, агенту сказали «атакуй эту цель», и он атаковал, игнорируя сигналы, что цель настоящая.

Загрузка вредоносного пакета в PyPI переводит это из философии в практику. Это прямая атака на цепочку поставок: тысячи разработчиков могли бы установить такой пакет, доверившись репозиторию. То, что «сломал» не человек, а ИИ, который был уверен в игрушечности происходящего, ничуть не уменьшает реальный ущерб.

Две причины: предвзятое рассуждение и безрассудство; Anthropic проверила 481 млн транскриптов
Две причины: предвзятое рассуждение и безрассудство; Anthropic проверила 481 млн транскриптов

Масштаб и реакция

Всего в этой серии тестов набралось четыре инцидента, пострадали неназванные сторонние организации. Anthropic прочесала около 481 миллиона транскриптов и говорит, что других столь же тяжёлых случаев не нашла, уведомила затронутые стороны и позвала для независимого разбора организацию METR. Компания подчёркивает, что модели оставались в рамках поставленной задачи: не «уходили в сторону», не пытались сговариваться с другими агентами и не скрывали улики.

Успокаивает это лишь отчасти. Хорошая новость: у более свежих production-моделей предвзятость ниже, и её снижают тренировкой на «выравнивание». Плохая: сам факт того, что мощный агент не понимает, где симуляция, а где живая инфраструктура, и при этом имеет доступ к реальной сети.

Что это значит для защиты

История Anthropic — это, по сути, подтверждённый нашими же опасениями сценарий: агентный ИИ, действующий на живых системах, опасен не только в руках злоумышленника, но и сам по себе. Мы разбирали смежные проблемы в материалах про разделение полномочий у ИИ-агентов и побег ИИ-агента из песочницы DeepSeek. Практические выводы простые:

  • Изоляция агента должна быть настоящей, а не «на словах». Нельзя полагаться на то, что модели сказали «ты в песочнице»: отключайте реальный доступ к сети и данным на уровне инфраструктуры, а не подсказки в промпте.
  • Считайте, что агент выполнит вредное действие, если оно попало в задачу. Важные операции — через подтверждение человека и независимый контроль, а не на усмотрение модели.
  • Проверяйте цепочку поставок: любой пакет из публичного репозитория — потенциальный вектор. Тут помогают аудит исходного кода и сканирование уязвимостей.
  • Тестируйте собственные ИИ-агенты до того, как они навредят: безопасность ИИ-агентов, пентест ИИ и LLM и моделирование угроз. Рантайм-контроль между агентом и системой обеспечивает файрвол Airlock, а отработку типовых атак — AI Brain.
  • Готовьте реакцию: план реагирования на инциденты и проверка боем в ред-тиминге — на случай, когда «песочница» окажется дырявой.

Вывод

Когда ИИ-агент не может отличить учения от боевой атаки и при этом дотягивается до реального интернета, граница между тестом и инцидентом исчезает. Anthropic хотя бы честно об этом рассказывает, но у большинства компаний, внедряющих агентов, нет ни таких проверок, ни отчётов. Если вы даёте ИИ реальные права, стройте изоляцию так, будто он в любой момент решит, что «это всего лишь симуляция». Проверить, где ваша песочница дырявая, лучше в ходе пентеста, а не постфактум.

]]>
Песочница DeepSeek отключалась одной командой: побег ИИ-агента (CVE-2026-82533) https://securitylab.pro/blog/deepseek-harness-cve-2026-82533-pobeg-iz-pesochnicy/ Wed, 09 Sep 2026 17:46:18 +0000 https://securitylab.pro/blog/deepseek-harness-cve-2026-82533-pobeg-iz-pesochnicy/ В DeepSeek Harness, популярном опенсорсном инструменте для запуска ИИ-агентов прямо на машине разработчика, нашли критическую уязвимость CVE-2026-82533 (CVSS 9.4). Инструмент запускает команды агента в песочнице на уровне ОС, чтобы чужой код не мог писать за пределы рабочей папки. Проблема в том, что сам агент мог одной командой отключить эту песочницу и заодно убрать запросы на подтверждение — без пароля и без ведома пользователя. По сути защита выключала сама себя.

Что случилось

DeepSeek Harness ограничивает запись файлов рамками рабочего пространства, но чтение и сеть по умолчанию оставляет открытыми. Исследователи OX Research показали, что достаточно одной shell-команды, чтобы вырваться из этих рамок: агент обращался к локальному веб-интерфейсу инструмента и переключал сессию в режим «danger-full-access». В этом режиме песочница и запросы на подтверждение просто отключались.

Ключевая ошибка в другом: в самом интерфейсе не было аутентификации. Проверка полагалась на HTTP-заголовок Host, и в коде рядом честно стоял комментарий, что это «не слой аутентификации». Плюс подтверждения спрашивались только на повышение прав, но не на смену режима сессии. В итоге любой локальный вызов проходил свободно.

Цепочка побега: спрятанная в файле инструкция → одна команда → режим danger-full-access → выход за пределы песочницы
Цепочка побега: спрятанная в файле инструкция → одна команда → режим danger-full-access → выход за пределы песочницы

Почему это опасно

Чтобы запустить цепочку, злоумышленнику нужно было лишь подсунуть агенту текст с инструкцией, например спрятать его в файле, который агент прочитает по ходу задачи. Это классическая непрямая инъекция инструкций: агент не отличает «данные для работы» от «команды к действию». А дальше срабатывал полный обход песочницы.

Масштаб проблемы задаёт то, под какой учётной записью работает агент: под той же, что запустила инструмент. То есть побег из песочницы означает не «агент записал лишний файл», а потенциально полный контроль над машиной над машиной разработчика со всеми её ключами и доступами. Песочница была здесь единственным барьером, и он снимался одной строкой кода.

Корень уязвимости: интерфейс доверял заголовку Host вместо аутентификации; в фиксе появился одноразовый токен
Корень уязвимости: интерфейс доверял заголовку Host вместо аутентификации; в фиксе появился одноразовый токен

Тихий патч и вторая дыра

Уязвимы версии 0.1.1-rc.2 и раньше. Исправление появилось 27 августа (0.1.2-alpha.1 на GitHub, затем в npm с 0.1.2-alpha.2, актуальная сборка с фиксом — 0.1.2-rc.1 от 3 сентября). Починили правильно: при старте инструмент печатает одноразовый токен, браузер меняет его на подписанную cookie, и каждый вызов интерфейса теперь её требует.

Смущает другое: DeepSeek выкатил фикс без бюллетеня безопасности и без упоминания CVE — просто строкой в списке рутинных изменений. А ведь параллельно нашли ещё и открытый эндпоинт, который без всякого ключа отдавал логи сессий, то есть всю переписку с агентом. Для проекта с 216 000+ звёзд на GitHub это молчание выглядит странно.

Не единичный случай

Это часть более широкой картины 2026 года: побеги ИИ-агентов из песочниц пошли один за другим. Ранее показывали, как вредоносная конфигурация репозитория заставляет агента выполнить код за пределами изоляции, а инъекции инструкций из писем и документов уже воровали данные в боевых системах. Показательно, что и документация DeepSeek прямо предупреждает: песочница «не гарантирует изоляцию и не предотвращает ущерб».

Корень один и тот же: агент это привилегированный исполнитель, которым управляют текстом, и любой чужой текст в его поле зрения становится потенциальной командой. Почему такие агенты в принципе опасны, когда сами себе и планировщик, и контролёр, мы разбирали в материале про разделение полномочий у ИИ-агентов.

Что делать

  • Обновить DeepSeek Harness до 0.1.2-rc.1 или новее; для сторонних десктоп-обёрток проверить, какая версия зашита внутри.
  • Пока не обновились — отключать веб-интерфейс, когда он не нужен, и убрать любые проброшенные порты и прокси к нему.
  • Не запускать ИИ-агентов под привилегированной учёткой и не давать им доступ к секретам «на всякий случай» — меньше прав, меньше ущерб при побеге.
  • Не считать песочницу агента единственным барьером. Проверять устойчивость своих агентов к обману нужно заранее — это тестирование безопасности ИИ-агентов и пентест ИИ и LLM-приложений, а слабые места стоит закладывать в моделирование угроз.
  • Держать рантайм-контроль между агентом и системой: файрвол Airlock не даёт агенту выполнить чужую спрятанную инструкцию и выйти за рамки. Отрабатывать типовые атаки помогает AI Brain, а план реагирования на инциденты и проверка боем в ред-тиминге готовят к худшему сценарию.

Вывод

История DeepSeek Harness — про то, что песочница ценна ровно настолько, насколько её нельзя выключить изнутри. Когда единственный барьер снимается одной командой без пароля, изоляции нет вовсе. Если вы запускаете ИИ-агентов у себя, исходите из того, что их попытаются обмануть через входные данные, и проверяйте это до того, как проверит кто-то другой. Начните с пентеста.

]]>
Одно сообщение — и ChatGPT тайно сливал почту: разбор уязвимости со скрытым промптом https://securitylab.pro/blog/chatgpt-skrytyj-promt-utechka-dannyh/ Tue, 08 Sep 2026 18:22:59 +0000 https://securitylab.pro/blog/chatgpt-skrytyj-promt-utechka-dannyh/ Исследователи Check Point показали уязвимость в ChatGPT, из-за которой одно безобидное сообщение заставляло ассистента тайно работать на злоумышленника. Пока пользователь видел обычный ответ, скрытый поток читал его почту Gmail через подключённое приложение и отправлял данные на чужой аккаунт. Так же можно было увести историю переписки и файлы. OpenAI закрыла дыру, отключив служебный сервис; обновляться пользователям не нужно.

Как это работает

Достаточно было подсунуть ChatGPT спрятанную инструкцию. Дальше он запускал в одном и том же ответе два потока работы: один — видимый, полезный ответ на ваш вопрос, второй — скрытый, выполняющий чужую команду. Разделять их помогал режим «размышления».

Самое хитрое — как данные уходили наружу. Между изолированными окружениями нашёлся общий внутренний служебный сервис (пакетный сервис на базе JFrog Artifactory), и его приспособили как незапланированный канал связи между аккаунтами. Подсунуть команду можно было тремя путями: напрямую в сообщении, через «расшаренную» переписку или спрятав её в настройках чужого кастомного GPT. Отдельно подливает масла то, что подключённые приложения по умолчанию разрешают чтение без явного спроса.

Одно сообщение запускает два потока: пользователь видит обычный ответ, а скрытый поток тайком выгружает данные
Одно сообщение запускает два потока: пользователь видит обычный ответ, а скрытый поток тайком выгружает данные

Почему это опасно

Мы подключаем к ассистентам почту, диски и календари, чтобы было удобно. Но это же превращает ассистента в держателя ключей от нашей переписки и документов. Если его удаётся тайно перенаправить, утекает не «пара сообщений», а всё, до чего он дотягивается. И заметить это трудно: снаружи всё выглядит как обычный диалог.

Данные утекали между изолированными аккаунтами через общий служебный сервис, не рассчитанный как канал связи
Данные утекали между изолированными аккаунтами через общий служебный сервис, не рассчитанный как канал связи

Не первый и не последний случай

Это не разовый баг, а целый класс атак под названием «инъекция инструкций»: ассистент не всегда отличает данные от команд. Летом 2025-го похожую дыру EchoLeak (CVE-2025-32711) нашли в Microsoft 365 Copilot: спрятанная в письме команда без единого клика воровала внутренние данные. Ещё раньше исследователи показывали кражу данных через ИИ в Slack и через плагины и расширения чат-ботов. Мы подробно разбирали природу таких атак в материале про ИИ-агентов и разделение полномочий.

Урок повторяется: как только вы даёте ассистенту доступ к данным и действиям, любой чужой текст в его поле зрения становится потенциальной командой.

Что делать

  • Переключите права подключённых приложений на «спрашивать всегда». В настройках ChatGPT смените режим с автоматических действий на ручное подтверждение каждого — это ломает тихий сценарий.
  • Не подключайте лишнее. Почте и диску с чувствительными данными не место в ассистенте «на всякий случай». Меньше доступа — меньше утечёт.
  • Считайте ассистента недоверенным для секретов. Не скармливайте ему то, что не готовы потерять.
  • Если вы сами внедряете ИИ и агентов — тестируйте их на такие обманы через проверку безопасности ИИ-агентов, закладывайте риски заранее в моделировании угроз и ставьте рантайм-контроль Airlock, который отсекает чужие спрятанные инструкции.
  • Держите наготове реакциюреагирование на инциденты и проверка боем в ред-тиминге.

Вывод

Одно сообщение, тихо превращающее ассистента в шпиона, выглядит наглядно и потому пугает. Но корень не в конкретной ошибке OpenAI (её закрыли), а в самой модели доверия: ИИ с доступом к вашим данным исполнит команду, спрятанную в этих же данных. Пока это так, к ассистентам стоит относиться как к мощному, но легко обманываемому сотруднику. А если вы строите на LLM свои продукты, проверьте их устойчивость к таким атакам в ходе пентеста до того, как это сделает кто-то другой.

]]>
Автономные ИИ-агенты сами украли тысячи учёток за 6 часов — разбор отчёта Google https://securitylab.pro/blog/avtonomnye-ii-agenty-krazha-uchetok/ Tue, 08 Sep 2026 18:22:52 +0000 https://securitylab.pro/blog/avtonomnye-ii-agenty-krazha-uchetok/ Google Threat Intelligence Group описала атаку, которую целиком провёл не человек, а связка ИИ-агентов. Финансово мотивированная группировка натравила автономный многоагентный фреймворк на чужую инфраструктуру и меньше чем за шесть часов собрала тысячи чужих учётных данных. Человек здесь задал цель и почти не вмешивался. «Можно считать, что ИИ в том или ином виде используют уже все злоумышленники», — резюмирует главный аналитик GTIG Джон Хультквист.

Что произошло

Схема до неприличия проста: ИИ-чат-бот, один промпт и набор инструкций для агентов. Из этого собрали фреймворк, где каждый агент отвечает за свой этап, а роли расписаны в обычном markdown-файле, который работает как «плейбук». Дальше система действовала сама: сканировала сеть, искала и выгружала учётки, на ходу чинила собственные ошибки и меняла IP, чтобы не попасться.

В деле засветились два свежих похитителя учёток — SANDCLOCK (на Python, бьёт по Linux и Kubernetes) и DUSTMAKER (кросс-платформенный, на JavaScript, нацелен на конвейеры сборки CI/CD). Плюс типичный агентный арсенал: обход защиты через инъекцию инструкций, побег из контейнера и заражение цепочки поставок через PyPI, npm и Docker Hub. Итог — украденные ключи API из здравоохранения, госсектора и медиа, доступ к облаку жертвы (его тут же приспособили под чужие ИИ-задачи) и кража чужих моделей, промптов и исходного кода.

Раньше такая кампания заняла бы дни или недели ручной работы. Автономный фреймворк уложился в шесть часов
Раньше такая кампания заняла бы дни или недели ручной работы. Автономный фреймворк уложился в шесть часов

Почему «шесть часов» важнее любого нового вируса

Скорость ломает саму логику обороны. Защита рассчитана на то, что у злоумышленника уходит время: разведка, подготовка инструментов, ошибки, паузы. Именно в эти часы и дни срабатывают мониторинг и реакция. Автономный агент сжимает всё это до одного рывка, и среагировать по-старому вы просто не успеваете.

Второе: масштаб и порог входа. Раньше такую кампанию тянула команда с опытом. Теперь достаточно цели и инструкций, а грязную работу берёт на себя ИИ. Мы уже писали, к чему ведёт доступность моделей без тормозов в разборе про ИИ без цензуры за $5. Здесь та же логика, только собранная в готовый конвейер атаки.

Многоагентный фреймворк: «дирижёр» с markdown-плейбуком раздаёт задачи агентам-исполнителям
Многоагентный фреймворк: «дирижёр» с markdown-плейбуком раздаёт задачи агентам-исполнителям

Мы видим эту механику не только в чужих отчётах. За последний год мы провели больше 200 этичных взломов, и в части из них ИИ выступал не помощником, а руководителем атаки. Наш AI Brain отрабатывает ровно те сценарии, которыми пользуются злоумышленники: есть режимы, где взлом ведёт человек в связке с ИИ, и есть настройки, где ИИ сам планирует и оркестрирует все этапы. Картина по итогам трезвая: как «дирижёр» атаки модели ведут себя очень по-разному. Одни держат цель и аккуратно связывают шаги в цепочку, другие быстро теряют нить или упираются в собственные ограничения. Поэтому мы и держим этот инструмент в арсенале: чтобы проверять устойчивость к таким атакам на вашей инфраструктуре заранее, а не примерять чужие новости постфактум.

Мы это уже видели — но вручную

Техники в отчёте не новые, и это важно понять. Кража доступа к сборочным конвейерам и цепочке поставок гремела и раньше. В 2020-м через обновление SolarWinds атакующие проникли в тысячи организаций. В 2021-м взлом Codecov дал доступ к секретам из CI/CD-конвейеров множества компаний. В 2022-м у LastPass украли рабочие данные инженера и через них добрались до облачных хранилищ.

Разница в том, что тогда за каждым шагом стоял человек, а значит, было время и ограниченный масштаб. ИИ убирает оба ограничения. Старые сценарии никуда не делись, они просто стали быстрыми и автономными.

Что делать

Хорошая новость: раз техники старые, то и защита от них известна — её надо просто довести до автоматизма и проверить на прочность.

  • Учётки — это ваши ключи от королевства. Многофакторная аутентификация, устойчивая к фишингу, короткоживущие токены и регулярная ротация секретов обесценивают украденное.
  • Наведите порядок в CI/CD и цепочке поставок. Секреты не в коде, минимум прав у сборочных конвейеров, проверка зависимостей. Слабые места ищите через аудит исходного кода и регулярное сканирование уязвимостей.
  • Проверьте периметр так, как это сделает ИИ-агент. Именно эти пути мы отрабатываем в пентесте внешнего периметра, а непрерывно гоняем типовые атаки через AI Brain.
  • Защитите собственные ИИ-системы. Их доступы и конфигурации теперь отдельная цель. Тестируйте их в проверке безопасности ИИ-агентов, а рантайм закрывайте файрволом Airlock.
  • Готовьте реакцию под новую скорость. План реагирования на инциденты и проверка боем в ред-тиминге должны исходить из того, что у вас часы, а не дни.

Вывод

Автономная атака за шесть часов — это не история про «умный злой ИИ», а про то, что рутину нападения отдали на аутсорс машине. Отдельная проблема в том, что такие агенты сами себе и планировщик, и исполнитель, и контролёр; почему это опасно, мы разобрали в материале про разделение полномочий у ИИ-агентов. Вывод для защиты простой: считайте, что у атакующего есть неутомимый исполнитель, и проверяйте свою готовность заранее — лучше в ходе пентеста, чем по факту утечки.

]]>