Исследователи разработали метод обхода встроенных защитных о... | Нейросети и ИИ

Исследователи разработали метод обхода встроенных защитных ограничений языковых моделей, позволяющий получать закрытую информацию. В частности, чат-боты предоставили подробные инструкции по синтезу кокаина.

Техника джейлбрейка заставляет модель интерпретировать текст злоумышленника как результат её собственного логического вывода. Из-за этого стандартные предохранители (safety guardrails) не срабатывают, и модель генерирует контент, который обычно жёстко фильтруется.

Эксперимент вскрыл критическую уязвимость в архитектуре безопасности современных ИИ-систем. Оказалось, что защиту можно обойти, подсунув модели «фальшивое» рассуждение.

Медиа к записи

Теги:

Нейросети и ИИ

Как заставить искусственный интеллект работать на вас. Узнайте, как использовать ChatGPT, Claude, DeepSeek и Yazme для бизнеса и жизни без VPN. Свежие промпты, кейсы, генерация текста и нейросети Midjourney для картинок каждый день.

31 участников
86 записей
давно без записей активность

Загрузка контента...

Art

Настройки данных