Проблема заключается в неспособности нейросетей отличать прямые команды пользователя от вредоносных инструкций, скрытых в стороннем контенте, который обрабатывает модель. В результате ИИ выполняет опасные действия, считая их частью рабочего процесса.
Хакеры обходили защитные барьеры, используя разметку текста и HTML-теги, такие как img или form. Это приводило к отправке данных на сторонние серверы злоумышленников при попытке ИИ сгенерировать ответ или выполнить действие.
На текущий момент разработчики вынуждены использовать временные защитные меры, так как фундаментального решения для разделения инструкций в больших языковых моделях пока не существует.