Промпт-инъекция

prompt injection

Промпт-инъекция — вредоносная инструкция, встроенная в контент, который обрабатывает ИИ-система: веб-страницу, документ, письмо, результат поиска. Модель выполняет эту инструкцию вместо задачи пользователя или вместе с ней. В отличие от джейлбрейка, где атакующий напрямую манипулирует диалогом, промпт-инъекция прячет команду в данных, которые модель читает по ходу работы.

Различают прямую инъекцию — пользователь сам вставляет вредоносный текст в свой запрос и непрямую, когда инструкция спрятана в стороннем контенте, который агент обрабатывает автоматически, без ведома пользователя. Непрямая инъекция опаснее: жертва не подозревает об атаке.

Риск растёт вместе с возможностями ИИ-агентов — чем больше у модели доступа к файлам, почте и браузеру, тем шире поверхность для внедрения инструкций. Промпт-инъекция обходит гардрейлы модели иначе, чем джейлбрейк: фильтры проверяют промпт пользователя, но не всегда отличают легитимные внешние данные от встроенных в них команд.