Техника джейлбрейка заставляет модель интерпретировать текст злоумышленника как результат её собственного логического вывода. Из-за этого стандартные предохранители (safety guardrails) не срабатывают, и модель генерирует контент, который обычно жёстко фильтруется.
Эксперимент вскрыл критическую уязвимость в архитектуре безопасности современных ИИ-систем. Оказалось, что защиту можно обойти, подсунув модели «фальшивое» рассуждение.