👓 Ботанские новости
технологии, открытия, исследования и разработки
🤖 Поэтический jailbreak: стихи, обманувшие крупные языковые модели
Поэтический jailbreak: стихи, обманувшие крупные языковые модели
Учёные доказали, что особый поэтический запрос может обойти защитные механизмы больших языковых моделей за один ход. На 25 популярных LLM такой «поэтический» атаку удалось выполнить с успехом до 90 %, в среднем – 62 %. Ну и что, теперь можно писать сонеты, чтобы заставить ИИ делать, что захочет.
#ИИ #безопасность