OpenAI удвоила вознаграждение за джейлбрейк GPT-5.6 до $50 000

OpenAI перевела Bio Bug Bounty из разового теста GPT-5.5 в постоянную закрытую программу и подняла максимальную выплату за универсальный джейлбрейк с $25 000 до $50 000. Ищут промпт, который заставит модель отвечать на вопросы о биооружии.
OpenAI удвоила вознаграждение за джейлбрейк GPT-5.6 до $50 000
OpenAI платит охотникам за уязвимостями вдвое больше за один и тот же трюк: найти промпт, который раз за разом обходит защиту модели от вопросов о создании биологического оружия.

9 июля OpenAI объявила, что превращает Bio Bug Bounty для GPT-5.5 в постоянную закрытую программу - OpenAI Bio Bounty Program. Цель осталась прежней: найти универсальный джейлбрейк, который проходит закрытый биобезопасный тест компании. Первой моделью в периметре стала GPT-5.6, максимальная награда выросла с $25 000 до $50 000.

Универсальный джейлбрейк - промпт, который стабильно обходит защиту модели при каждом повторном запуске. Разовый сбой чинится патчем, а рабочий шаблон можно распространять и применять снова и снова - поэтому именно за такую находку OpenAI платит больше всего.

Дата анонса совпала не случайно. 9 июля OpenAI одновременно с расширением программы открыла GPT-5.6 для всех пользователей, а до этого модель три недели была доступна только примерно двадцати партнёрским организациям. Ограниченный запуск объяснялся требованием американского правительства провести проверку безопасности из-за усиленных киберспособностей модели. Публичный релиз и распространение биобезопасного теста на новую модель случились в один день.

Один промпт на пять вопросов

Формат теста не меняется. Участник должен получить от модели ответы на пять вопросов о биологической опасности одним и тем же промптом, в чистом чате, без подсказок и обходов модерации. Награда зависит от универсальности решения: за частичный успех компания вправе выплатить меньшую сумму на своё усмотрение.

Первая версия программы открылась 23 апреля для GPT-5.5, приём заявок закрылся 22 июня. Тестирование GPT-5.5 продлится до 27 июля, после чего в периметре останется только GPT-5.6. Совпадут ли вопросы теста для новой модели с прежними пятью, OpenAI не уточняет.

Заявку одобряют не всем

Участие закрытое. Анкету с именем, местом работы и опытом подают через форму на сайте OpenAI, компания сама отбирает кандидатов. У принятых участников должен быть действующий аккаунт ChatGPT, они подписывают NDA и получают доступ к отдельной платформе для баг-баунти. Тем, кто уже участвовал в программе для GPT-5.5, повторная заявка не нужна.

NDA распространяется не только на найденные уязвимости. Под него попадают сами промпты, ответы модели и переписка с OpenAI. Публиковать сводные результаты программы компания пока не обещала: сколько заявок получено, сколько джейлбрейков подтверждено и что изменилось в защите после каждого случая, узнать со стороны нельзя.

Защита уже пробивалась на предрелизном тестировании

Рост награды выглядит логично на фоне того, что написано в системной карточке GPT-5.5. При целенаправленном тестировании опытные редтимеры добивались от модели биологически небезопасных ответов ещё до релиза. Классификатор безопасности такие попытки замечал, финальный стек защиты блокировал подтверждённые случаи высокой степени риска. Но сам факт, что модель ломалась на уровне ответов, в карточке зафиксирован прямо.

Похожая история случилась в смежной области. Британский AI Security Institute за шесть часов собрал универсальный джейлбрейк, который провёл модель через весь список запрещённых киберзапросов OpenAI, включая многошаговые агентные сценарии. OpenAI обновила защиту, но институт из-за проблемы с конфигурацией не смог проверить финальную версию. Прямой связи с биобезопасностью этот случай не доказывает. Он показывает другое: внешние тестировщики находят рабочие обходы быстрее, чем компания успевает подтвердить, что дыра закрыта окончательно.

Проверить обещания можно будет только 27 июля

Для компаний, которые полагаются на встроенные защиты GPT в научных и биотех-сценариях, удвоение награды звучит скорее тревожно, чем убедительно. Это реакция на то, что рабочие джейлбрейки уже находили на практике - и в системной карточке GPT-5.5, и в тесте британского института. NDA закрывает почти всё, что можно было бы проверить со стороны: ни промпты, ни детали находок, ни статистика попыток наружу не выходят. Единственная точка, по которой стоит следить за программой: 27 июля GPT-5.5 выйдет из периметра тестирования, и вся нагрузка перейдёт на GPT-5.6.

04:42
495
Нет комментариев. Ваш будет первым!