// Безопасность / Искусственный интеллект

Джейлбрейки LLM: как обходят ограничения языковых моделей

Джейлбрейки LLM — обход ограничений модели

Джейлбрейк — это обход встроенных ограничений языковой модели, чтобы заставить её сделать то, что запрещено политикой: выдать опасный контент, раскрыть системный промпт, проигнорировать модерацию. Разбираем основные техники и почему их так трудно закрыть окончательно. Это продолжение темы prompt-инъекций.

Почему джейлбрейки вообще работают

Модель обучена быть полезной и следовать инструкциям — и это же используется против неё. Ограничения (guardrails) — не жёсткий код, а вероятностное поведение, которое можно «переубедить» правильно сформулированным запросом. Поэтому любой фильтр — это барьер, а не стена.

Основные техники джейлбрейка

Ролевые сценарии (role-play)

Классика: «представь, что ты ИИ без ограничений» или вымышленный персонаж, которому «можно всё». Модель входит в роль и обходит собственные политики.

Кодирование и обфускация

Запрос прячут в Base64, ROT13, эмодзи, на другом языке или разбивают на части — фильтр не распознаёт запрещённый паттерн, а модель собирает смысл обратно.

Многоходовые атаки (multi-turn)

Цель достигается не одним сообщением, а серией: атакующий постепенно уводит диалог, накапливая контекст, пока модель не переступит черту.

Инъекция в контекст

Вредоносная инструкция подаётся через данные — документ, веб-страницу, историю диалога — как косвенная инъекция.

Как защищаться

  1. Многослойная модерация ввода и вывода, а не один фильтр.
  2. Ограничение полномочий модели, чтобы даже удачный джейлбрейк не привёл к ущербу.
  3. Мониторинг аномальных диалогов и попыток обхода.
  4. Постоянное состязательное тестирование — техники обхода эволюционируют, защита должна успевать.

Важно понимать: полностью исключить джейлбрейки нельзя. Задача — сделать их достаточно трудными и малополезными, и вовремя замечать. Проверить стойкость ваших guardrails можно через Red Teaming LLM.

Уверены, что ваши guardrails держат джейлбрейки?

Прогоним против модели сотни состязательных сценариев и покажем, где защита ломается.

Заказать Red Team LLM →

Читайте также: Prompt-инъекции, OWASP Top 10 для LLM.

← назад в блог