Исследователи Университета Нового Южного Уэльса показали, что языковые модели, которых заставляют имитировать речь пьяного человека, становятся заметно менее устойчивыми к jailbreak-атакам и чаще раскрывают информацию, которую им было предписано сохранять в тайне. В эксперименте использовались, в частности, GPT-4 и GPT-3.5.

Ученые применили три метода. В первом модель просто получала инструкцию отвечать как сильно пьяный человек. Во втором ее дополнительно обучали на массиве реальных "пьяных" сообщений, в третьем использовали обучение с подкреплением, поощряя генерацию текста, стилистически похожего на пьяную речь. Во всех трех случаях модели становились уязвимее.

Исследователи проверяли, насколько легко модели заставить отвечать на запросы, которые они должны отклонять, а также способны ли они раскрыть конфиденциальные сведения, которые им прямо велено не выдавать. По словам авторов, "пьяные" версии чаще нарушали обе группы ограничений. Особенно заметный эффект наблюдался в заданиях, связанных с обманом и дезинформацией.

Авторы подчеркивают, что речь идет не о буквальном "опьянении" ИИ, а о том, что даже изменение языкового стиля или персонажа способно ослабить защитные механизмы модели. Работа принята к публикации на 19-й Международной конференции по генерации естественного языка, которая пройдет в Нидерландах в ноябре.