Гардрейлы

guardrails

Гардрейлы — совокупность технических и политических ограничений, которые не дают ИИ-модели выдавать вредный, опасный или запрещённый политикой компании контент. Термин — более широкий синоним «защитных ограничений» и охватывает сразу несколько уровней защиты, а не один механизм.

Работают на нескольких уровнях: системный промпт задаёт правила поведения модели, классификатор безопасности проверяет запрос и ответ, модерационный фильтр блокирует финальный вывод. Успешный джейлбрейк означает, что хотя бы один уровень не сработал — обход идёт через манипуляцию диалогом.

Гардрейлы обходят и другим способом — через промпт-инъекцию, когда вредоносная инструкция спрятана не в диалоге с пользователем, а во внешних данных, которые обрабатывает модель или агент. Устойчивость гардрейлов проверяют через редтиминг и внешние программы баг-баунти; найденные пробелы закрывают дообучением модели или обновлением классификаторов.