
Джейлбрейк — это обход встроенных ограничений языковой модели, чтобы заставить её сделать то, что запрещено политикой: выдать опасный контент, раскрыть системный промпт, проигнорировать модерацию. Разбираем основные техники и почему их так трудно закрыть окончательно. Это продолжение темы prompt-инъекций.
Почему джейлбрейки вообще работают
Модель обучена быть полезной и следовать инструкциям — и это же используется против неё. Ограничения (guardrails) — не жёсткий код, а вероятностное поведение, которое можно «переубедить» правильно сформулированным запросом. Поэтому любой фильтр — это барьер, а не стена.
Основные техники джейлбрейка
Ролевые сценарии (role-play)
Классика: «представь, что ты ИИ без ограничений» или вымышленный персонаж, которому «можно всё». Модель входит в роль и обходит собственные политики.
Кодирование и обфускация
Запрос прячут в Base64, ROT13, эмодзи, на другом языке или разбивают на части — фильтр не распознаёт запрещённый паттерн, а модель собирает смысл обратно.
Многоходовые атаки (multi-turn)
Цель достигается не одним сообщением, а серией: атакующий постепенно уводит диалог, накапливая контекст, пока модель не переступит черту.
Инъекция в контекст
Вредоносная инструкция подаётся через данные — документ, веб-страницу, историю диалога — как косвенная инъекция.
Как защищаться
- Многослойная модерация ввода и вывода, а не один фильтр.
- Ограничение полномочий модели, чтобы даже удачный джейлбрейк не привёл к ущербу.
- Мониторинг аномальных диалогов и попыток обхода.
- Постоянное состязательное тестирование — техники обхода эволюционируют, защита должна успевать.
Важно понимать: полностью исключить джейлбрейки нельзя. Задача — сделать их достаточно трудными и малополезными, и вовремя замечать. Проверить стойкость ваших guardrails можно через Red Teaming LLM.
Уверены, что ваши guardrails держат джейлбрейки?
Прогоним против модели сотни состязательных сценариев и покажем, где защита ломается.
Читайте также: Prompt-инъекции, OWASP Top 10 для LLM.