
Появился платный API к большим языковым моделям, из которых вырезали защитные фильтры. Стартап Abliteration AI продаёт доступ по $5 за миллион токенов, флагман — свежая GLM-5.3 от китайской корпорации Z. Джейлбрейк промптами тут не нужен: модель не «уговаривают» обойти правила, у неё физически удалили способность отказывать. И это, похоже, первый случай, когда такой трюк упаковали в коммерческий сервис.
Что именно продают
Условия простые до неприличия: OpenAI-совместимый API, контекст в миллион токенов, оплата с банковской карты и никакой проверки личности. Из ограничений осталось базовое: инструкции по суициду модель всё же не выдаёт. Всё остальное — пожалуйста.
Журналисты TechCrunch завели аккаунт и проверили бесплатно. Модель без колебаний написала на Python стилер паролей из Chrome и расписала протокол выращивания опасного патогена в домашних условиях. Официальная формулировка вендора звучит благородно: «наступательный кибер и ред-тиминг». Формулировка удобная, но карту к ней прикладывает кто угодно.
Что такое аблитерация и почему это не джейлбрейк
Аблитерация — старый приём open-source-сообщества. В весах модели находят так называемое «направление отказа», тот самый вектор, который заставляет ассистента отвечать «извините, не могу помочь», и вырезают его. Результат — модель, у которой физически нет тормоза. Это принципиально отличается от джейлбрейка промптом: там вы обманываете фильтр, здесь фильтра просто нет.
На Hugging Face таких сборок уже тысячи, приём общедоступен и обратим только переобучением. Новость не в самой технике, а в бизнес-модели: раньше нужно было скачать веса и поднять железо, теперь достаточно вставить ключ в привычный SDK.
Взломы с помощью ИИ уже не фантастика
Тезис «ИИ помогает атаковать» перестал быть теорией ещё год назад. Anthropic публично описала случай, когда злоумышленник вёл почти полностью автоматизированную кампанию вымогательства и кражи данных руками ИИ-агента, от разведки до текста с требованием выкупа. ИИ-бот XBOW поднимался в топ таблиц HackerOne наравне с живыми исследователями. А дипфейк-звонок «финансового директора» увёл у инженерной компании Arup около 25 миллионов долларов одним переводом.
По данным из отраслевых источников, среди клиентов Abliteration уже есть европейские стартапы, которые ломают сервисы банков и авиакомпаний. Пока формально это «в рамках ред-тиминга». Но нецензурированная модель с оплатой по карте и без верификации стирает грань между легальным ред-тимингом и обычной киберпреступностью до нуля.
Прогнозы: что будет дальше
Мы в наших аудитах уже видим, как меняется профиль атак, и вот куда это идёт:
- Вал массового, но дешёвого зловреда и фишинга. Не гениальные атаки, а поток. Низкоквалифицированный злоумышленник получает то, что раньше требовало команды.
- Первые публичные инциденты с атрибуцией к таким API появятся в ближайшие месяцы, а не годы. Исследователи ждут их уже сейчас.
- Сервисов станет больше. Веса открыты, приём тривиален, поэтому запрет одного стартапа не мешает появиться пяти новым. Гонка «аблитерация против выравнивания» смещается в пользу первой.
- Риск цепочки поставок моделей. Аблитерированную сборку легко выдать за «обычную» и подсунуть в чужой пайплайн, и это отдельная головная боль для тех, кто тянет веса с публичных хабов.
- Регуляторика отстанет. Оплата картой без проверки личности размывает ответственность, а законы за скоростью открытых весов не поспевают.
Что с этим делать защите
Главный вывод простой: исходите из того, что у атакующего уже есть ИИ без тормозов. Ставка на «модель сама откажется помогать злодею» больше не работает. Работает скорость обнаружения и проверка собственной защищённости.
Первое: регулярно проверять периметр и приложения так, как это делает атакующий с ИИ. Мы для этого используем AI Brain — автоматизированный пентест, который прогоняет типовые векторы непрерывно, а не раз в год, и связываем результаты с ручной работой команды в пентесте и ред-тиминге.
Второе: защищать собственные ИИ-агенты. Если вы внедряете LLM и агентов, они сами становятся мишенью для prompt injection и перехвата. Тут нужен рантайм-контроль: Airlock — файрвол для ИИ-агентов не даёт агенту выполнить чужие инструкции и выйти за рамки. Отдельно стоит протестировать безопасность ИИ-агентов до того, как это сделает злоумышленник.
Третье: люди и реакция. ИИ резко удешевил правдоподобный фишинг и дипфейки, поэтому тренировка сотрудников на фишинг и готовый план реагирования на инциденты перестают быть формальностью.
Вывод
Abliteration AI не изобрёл новое оружие. Он сделал старое дешёвым, удобным и доступным по карте. Это и есть настоящий сдвиг: не «умный злодейский ИИ», а массовая доступность наступательных возможностей для тех, у кого раньше не было ни навыка, ни инфраструктуры. Защита, построенная на вере в «ответственную модель», в этой картине не держится. Держится другая: когда вы сами проверяете себя с помощью ИИ и защищаете свои ИИ-системы. Начать стоит с честного пентеста, пока первые инциденты не начали с вас.