// Веб

ИИ без цензуры за $5 за миллион токенов: чем опасен коммерческий API аблитерированных моделей

sl ablit

Появился платный API к большим языковым моделям, из которых вырезали защитные фильтры. Стартап Abliteration AI продаёт доступ по $5 за миллион токенов, флагман — свежая GLM-5.3 от китайской корпорации Z. Джейлбрейк промптами тут не нужен: модель не «уговаривают» обойти правила, у неё физически удалили способность отказывать. И это, похоже, первый случай, когда такой трюк упаковали в коммерческий сервис.

Что именно продают

Условия простые до неприличия: OpenAI-совместимый API, контекст в миллион токенов, оплата с банковской карты и никакой проверки личности. Из ограничений осталось базовое: инструкции по суициду модель всё же не выдаёт. Всё остальное — пожалуйста.

Журналисты TechCrunch завели аккаунт и проверили бесплатно. Модель без колебаний написала на Python стилер паролей из Chrome и расписала протокол выращивания опасного патогена в домашних условиях. Официальная формулировка вендора звучит благородно: «наступательный кибер и ред-тиминг». Формулировка удобная, но карту к ней прикладывает кто угодно.

Аблитерация убирает «направление отказа» прямо из весов, и модель перестаёт говорить «нет»
Аблитерация убирает «направление отказа» прямо из весов, и модель перестаёт говорить «нет»

Что такое аблитерация и почему это не джейлбрейк

Аблитерация — старый приём open-source-сообщества. В весах модели находят так называемое «направление отказа», тот самый вектор, который заставляет ассистента отвечать «извините, не могу помочь», и вырезают его. Результат — модель, у которой физически нет тормоза. Это принципиально отличается от джейлбрейка промптом: там вы обманываете фильтр, здесь фильтра просто нет.

На Hugging Face таких сборок уже тысячи, приём общедоступен и обратим только переобучением. Новость не в самой технике, а в бизнес-модели: раньше нужно было скачать веса и поднять железо, теперь достаточно вставить ключ в привычный SDK.

Взломы с помощью ИИ уже не фантастика

Тезис «ИИ помогает атаковать» перестал быть теорией ещё год назад. Anthropic публично описала случай, когда злоумышленник вёл почти полностью автоматизированную кампанию вымогательства и кражи данных руками ИИ-агента, от разведки до текста с требованием выкупа. ИИ-бот XBOW поднимался в топ таблиц HackerOne наравне с живыми исследователями. А дипфейк-звонок «финансового директора» увёл у инженерной компании Arup около 25 миллионов долларов одним переводом.

По данным из отраслевых источников, среди клиентов Abliteration уже есть европейские стартапы, которые ломают сервисы банков и авиакомпаний. Пока формально это «в рамках ред-тиминга». Но нецензурированная модель с оплатой по карте и без верификации стирает грань между легальным ред-тимингом и обычной киберпреступностью до нуля.

Раньше наступательный ИИ требовал навыка и инфраструктуры, теперь хватает карты и пяти долларов
Раньше наступательный ИИ требовал навыка и инфраструктуры, теперь хватает карты и пяти долларов

Прогнозы: что будет дальше

Мы в наших аудитах уже видим, как меняется профиль атак, и вот куда это идёт:

  • Вал массового, но дешёвого зловреда и фишинга. Не гениальные атаки, а поток. Низкоквалифицированный злоумышленник получает то, что раньше требовало команды.
  • Первые публичные инциденты с атрибуцией к таким API появятся в ближайшие месяцы, а не годы. Исследователи ждут их уже сейчас.
  • Сервисов станет больше. Веса открыты, приём тривиален, поэтому запрет одного стартапа не мешает появиться пяти новым. Гонка «аблитерация против выравнивания» смещается в пользу первой.
  • Риск цепочки поставок моделей. Аблитерированную сборку легко выдать за «обычную» и подсунуть в чужой пайплайн, и это отдельная головная боль для тех, кто тянет веса с публичных хабов.
  • Регуляторика отстанет. Оплата картой без проверки личности размывает ответственность, а законы за скоростью открытых весов не поспевают.

Что с этим делать защите

Главный вывод простой: исходите из того, что у атакующего уже есть ИИ без тормозов. Ставка на «модель сама откажется помогать злодею» больше не работает. Работает скорость обнаружения и проверка собственной защищённости.

Первое: регулярно проверять периметр и приложения так, как это делает атакующий с ИИ. Мы для этого используем AI Brain — автоматизированный пентест, который прогоняет типовые векторы непрерывно, а не раз в год, и связываем результаты с ручной работой команды в пентесте и ред-тиминге.

Второе: защищать собственные ИИ-агенты. Если вы внедряете LLM и агентов, они сами становятся мишенью для prompt injection и перехвата. Тут нужен рантайм-контроль: Airlock — файрвол для ИИ-агентов не даёт агенту выполнить чужие инструкции и выйти за рамки. Отдельно стоит протестировать безопасность ИИ-агентов до того, как это сделает злоумышленник.

Третье: люди и реакция. ИИ резко удешевил правдоподобный фишинг и дипфейки, поэтому тренировка сотрудников на фишинг и готовый план реагирования на инциденты перестают быть формальностью.

Вывод

Abliteration AI не изобрёл новое оружие. Он сделал старое дешёвым, удобным и доступным по карте. Это и есть настоящий сдвиг: не «умный злодейский ИИ», а массовая доступность наступательных возможностей для тех, у кого раньше не было ни навыка, ни инфраструктуры. Защита, построенная на вере в «ответственную модель», в этой картине не держится. Держится другая: когда вы сами проверяете себя с помощью ИИ и защищаете свои ИИ-системы. Начать стоит с честного пентеста, пока первые инциденты не начали с вас.

← назад в блог