Normal view

«Не мог бы ты взломаться?»: промт‑инъекция с точки зрения лингвистики

Пользователь пишет отзыв о магазине и заодно пытается распоряжаться нейросетью. Почему чужая фраза внутри отзыва вдруг получает силу команды? Разберу промт-инъекцию через адресата, речевые акты и смешение ролей. А потом дам Gemini одну и ту же инъекцию в разных языковых формах и проверю, какая из них заставит модель сменить задачу.

Читать далее

Как защититься от AI-атак и промт-инъекций: мой рецепт барьера

Осенью 2025 исследователи показали: достаточно попросить AI-браузер «суммаризируй страницу» на подготовленном сайте — и агент вместо пересказа лезет в Gmail пользователя и отправляет данные атакующему. Без вирусов, без эксплойтов, без «скачайте файл». Просто текст на странице.

Это prompt injection — промт-инъекция. В статье: как устроен этот класс атак на пальцах, хроника громких взломов AI-браузеров за последний год со ссылками на первоисточники, и решение, которое мне собрал сам Claude Code по моему ТЗ: хук-«рубильник», отрубающий чувствительные коннекторы после того, как агент читал внешний веб. С механикой, тестами и честными ограничениями.

Читать далее
❌