GPT-Red: как OpenAI учит ИИ искать уязвимости в следующем поколении моделей

Проверять современные модели вручную становится слишком медленно
Каждая новая языковая модель проходит этап red teaming - проверки на устойчивость к вредоносным запросам, обходу ограничений, утечке данных и другим сценариям, которые могут привести к небезопасному поведению. Долгое время эту работу выполняли специалисты по безопасности и приглашённые исследователи.
Проблема в масштабе. Современные модели получают новые возможности быстрее, чем команды успевают придумывать для них новые атаки. Чем сложнее становится система, тем больше комбинаций запросов необходимо проверить. Полностью закрыть эту задачу ручным тестированием уже невозможно.
OpenAI считает, что следующий этап развития безопасности - автоматизация самого процесса поиска уязвимостей.
GPT-Red создаёт атаки быстрее человека
Для этого компания разработала GPT-Red - специализированную внутреннюю модель, которая генерирует новые способы обойти защиту других моделей.
В отличие от обычного чат-бота, её задача не помогать пользователю, а действовать как исследователь безопасности. GPT-Red получает цель, анализирует поведение проверяемой модели, строит новые цепочки запросов, комбинирует известные техники и пытается найти сценарии, в которых защита перестаёт работать.
Каждая успешная атака превращается в новый обучающий пример. После этого основную модель дообучают так, чтобы она корректно реагировала на найденный сценарий. Затем цикл повторяется снова.
Фактически OpenAI построила непрерывную систему, где одна модель ищет слабые места, а другая учится их устранять.
Безопасность превращается в соревнование моделей
Самая интересная часть исследования - отказ от классической схемы «человек ищет ошибки».
Теперь процесс напоминает соревнование двух систем. Одна постоянно придумывает новые способы обойти ограничения, другая учится этим атакам сопротивляться.
Подобный подход давно используется в кибербезопасности, где защитные механизмы развиваются одновременно с инструментами взлома. OpenAI переносит эту идею в разработку языковых моделей.
Компания называет этот процесс self-improvement for robustness - самоулучшением устойчивости. Важно сделать оговорку: речь не идёт о самостоятельном развитии ИИ в широком смысле. GPT-Red не создаёт новые модели и не меняет архитектуру GPT. Она автоматизирует поиск сложных сценариев, которые затем используют инженеры при обучении следующей версии.
GPT-5.6 Sol уже использует результаты этой системы
OpenAI сообщает, что GPT-Red применялась во время подготовки GPT-5.6 Sol.
По данным компании, использование автоматически сгенерированных атак позволило примерно в шесть раз снизить количество успешных prompt injection на самом сложном внутреннем наборе тестов. Для нескольких категорий атак ранее эффективные способы обхода защиты практически перестали работать.
Эти результаты относятся к внутренним бенчмаркам OpenAI, поэтому сравнить их с независимыми исследованиями пока нельзя. Однако сам подход выглядит важнее конкретных цифр.
Сегодня проблема уже не в том, чтобы найти одну удачную атаку. Намного сложнее быстро находить тысячи новых вариантов после каждого обновления модели. Именно эту задачу GPT-Red и пытается решить.
Почему GPT-Red отличается от RLHF
На первый взгляд может показаться, что речь идёт о ещё одном варианте RLHF - обучения на человеческой обратной связи.
Разница принципиальная.
RLHF помогает модели лучше понимать предпочтения человека: какие ответы считать полезными, какие - нежелательными.
GPT-Red работает раньше. Она создаёт новые стрессовые ситуации, которые люди могли не предусмотреть. Затем именно эти сценарии становятся материалом для дальнейшего обучения.
Получается своеобразный конвейер безопасности: поиск атаки → проверка → исправление → повторное тестирование.
Чем быстрее работает этот цикл, тем меньше времени проходит между обнаружением новой уязвимости и её устранением.
Это может изменить всю индустрию
Практически все крупные лаборатории уже используют автоматические инструменты тестирования. Anthropic исследует масштабируемые способы оценки моделей, Google развивает собственные системы безопасности Gemini, Microsoft активно инвестирует в автоматизированное тестирование ИИ.
Работа OpenAI интересна тем, что компания впервые подробно описала модель, которая сама специализируется на поиске новых атак, а не только на проверке заранее подготовленного набора тестов.
Если подобные системы станут стандартом, безопасность моделей перестанет зависеть исключительно от количества исследователей. Существенную часть работы смогут выполнять сами языковые модели.
Это особенно важно для агентных систем, которые получают доступ к браузеру, файловой системе, корпоративным документам и внешним сервисам. В таких сценариях стоимость ошибки значительно выше, чем у обычного чат-бота.
Почему OpenAI не публикует GPT-Red
Несмотря на публикацию исследования, сама модель остаётся внутренним инструментом.
Причина понятна. Система, способная автоматически искать способы обхода защитных механизмов, одинаково полезна и для разработчиков, и для злоумышленников. Поэтому OpenAI ограничилась описанием архитектуры, методики обучения и полученных результатов.
Такой подход показывает, что компания рассматривает GPT-Red как часть собственной инфраструктуры безопасности, а не как коммерческий продукт.
Главный вывод
Исследование GPT-Red интересно не тем, что OpenAI создала ещё одну языковую модель.
Гораздо важнее другое: компания начинает передавать самому искусственному интеллекту одну из самых трудоёмких задач разработки - поиск слабых мест следующего поколения ИИ.
Пока люди по-прежнему определяют цели, контролируют процесс и принимают решения о дообучении моделей. Но объём работы, который выполняет автоматизированная система безопасности, быстро растёт.
Если этот подход подтвердит эффективность в следующих поколениях моделей, разработка ИИ станет всё больше похожа на непрерывный цикл соревнования двух систем: одна ищет новые способы атаковать, другая учится защищаться. Именно скорость этого цикла может стать одним из главных факторов качества и безопасности будущих моделей.