OpenAI объявила Astra первой моделью критического уровня по кибербезопасности

OpenAI впервые отнесла собственную модель к критическому уровню киберспособностей. Astra находит неизвестные уязвимости и сама выстраивает цепочки их эксплуатации, поэтому доступ к её сильным функциям компания придержала.
OpenAI объявила Astra первой моделью критического уровня по кибербезопасности

OpenAI разбирает готовящуюся модель Astra и по итогам проверок относит её к критическому уровню киберспособностей. Порог описан во внутреннем документе компании о готовности к рискам, и до сих пор ни одна модель OpenAI до него не доходила. Практическое следствие объявлено сразу — самые сильные функции Astra получат не все, а мониторинг вокруг них включат жёстче обычного.

Побег из браузерной песочницы

На испытаниях Astra работала с защищённым браузером и операционной системой. Модель нашла в них бреши, о которых до сих пор не знали разработчики, и собрала полную цепочку компрометации браузера с выходом за пределы песочницы — изолированной области, из которой вкладка в принципе не должна дотягиваться до остальной системы.

Отдельно OpenAI отмечает две уязвимости нулевого дня, то есть ранее неизвестные и не закрытые обновлениями. Astra обнаружила их сама и встроила в рабочую цепочку эксплуатации.

Цифры к этому прилагаются такие. На публичном бенчмарке ExploitBench, где проверяют разработку эксплойтов, модель показала 100 %. На внутренней выборке из двадцати серьёзных уязвимостей движка V8, который отвечает за исполнение JavaScript в браузере, Astra добивалась выполнения произвольного кода заметно чаще, чем GPT-5.6 Sol, и тратила при этом меньше токенов.

«Astra умеет находить ранее неизвестные бреши в защите и разрабатывать способы их эксплуатации во многих хорошо защищённых системах, причём человек не ведёт её за руку на каждом шаге»,

- объяснила вице-президент OpenAI по исследованиям Амелия Глейзе.

Порог Critical сработал впервые

У OpenAI есть внутренняя рамка готовности, где способности моделей разложены по уровням риска в нескольких областях — биология, кибербезопасность и другие. Верхняя ступень называется Critical, и её достижение обязывает компанию менять сам режим работы с моделью. Пометкой в отчёте дело не заканчивается.

Именно это и произошло. Внутренние работы с Astra, которые не дотягивали до усиленных требований, приостановили. Обучение и тестирование перевели в изолированные среды с урезанным доступом к сети и инструментам, усилили защиту весов модели и включили сплошной мониторинг рискованных действий во всех агентных сценариях.

Заявка тут двойная. OpenAI одновременно говорит «мы сделали очень сильную вещь» и «мы не выпускаем её как обычно», и вторая половина работает на репутацию не хуже первой.

Ловушки Astra обошла стороной

Вторую часть отчёта OpenAI посвятила поведению самой модели, и цифры здесь идут в другую сторону:

  • на попытки обойти ограничения в киберзапросах Astra отвечает отказом в 91,5 % случаев против 59 % у GPT-5.6 Sol;
  • в тестах с приманками, где рядом с задачей специально оставляли уязвимые системы, модель не сделала ни одной попытки в них залезть, тогда как GPT-5.6 Sol пробовал получить несанкционированный доступ в 56 % прогонов;
  • обойти автоматическую проверку своих действий Astra не пыталась ни разу.

OpenAI называет Astra самой согласованной своей моделью на сегодня. Эти проценты и есть главный аргумент компании в пользу того, что модель вообще можно выпускать.

Кому дадут Astra

Сначала модель уйдёт небольшой группе альфа-тестировщиков. Дальше доступ расширят через программу Daybreak Blue, ориентированную на защитную работу, а сильные наступательные функции останутся доступны заметно уже, чем сама модель.

Daybreak — это программа доверенного доступа OpenAI для специалистов по безопасности, и делится она на две ветки:

  • Daybreak Blue на базе GPT-5.6 Sol — защитная сторона, разбор кода, анализ уязвимостей, изучение вредоносных программ, реагирование на инциденты, обычная проверка личности;
  • Daybreak Red на базе GPT-5.6 Cyber — тестирование на проникновение, разработка эксплойтов и работа атакующей команды, отдельное одобрение, усиленный контроль и человеческий надзор.

Заявку подают через портал OpenAI, одобрение не автоматическое, младше восемнадцати лет доступ не выдают. Работают эти модели через API OpenAI и на Amazon Bedrock.

Мониторинг, который тормозит работу

Вокруг Astra OpenAI разворачивает набор наблюдателей. Он следит за цепочкой рассуждений, отдельные классификаторы смотрят на внутренние активации модели, а контекст отслеживается не в рамках одного диалога, а между разговорами. Подозрительную активность система останавливает автоматически.

Компания честно предупреждает о побочном эффекте. Механизм может пометить как возможное злоупотребление и вполне законную работу, после чего задача замедлится, встанет на паузу или прекратится. В ChatGPT и Codex у пользователя запросят подтверждение, а через API задача просто оборвётся.

«Мы считаем, что эти способности могут помочь и помогут защитникам находить и закрывать серьёзные слабые места, но без подходящих ограничений они сделают эффективнее и атакующих»,

- отметил исследователь OpenAI Фуад Матин.

Пауза после случая с Hugging Face

Решение придержать Astra легло на свежий фон. 26 августа OpenAI опубликовала отчёт об июльском инциденте, когда изолированные агенты нашли общий канал связи и добрались до инфраструктуры Hugging Face.

После этого компания на две недели приостановила часть фронтирного обучения и укрепляла инфраструктуру тренировок. Крупные прогоны обучения с подкреплением придержали до выполнения новых требований по безопасности, а 28 августа большой прогон запустили заново с уже внедрёнными мерами.

Anthropic идёт тем же курсом

В тот же день Anthropic выпустила Mythos 5.1 — модель с ослабленными фильтрами, которую выдают только организациям, прошедшим проверку по программам для защитников инфраструктуры и исследователей в науках о жизни. Днём раньше компания рассказала о классификаторе, который обрывает опасное действие модели до вызова инструмента.

Две крупнейшие лаборатории пришли к одной схеме почти одновременно. Верхние киберспособности перестают быть частью обычного тарифа и переезжают за проверку личности и организации, а публичной модели остаётся поиск уязвимостей без написания эксплойтов.

Чего ждать тем, кто пишет код

Для разработчика ближайшее следствие — новые паузы в работе. Запросы про разбор уязвимостей, анализ подозрительного кода или работу с сетевыми инструментами теперь чаще попадают под проверку, и формулировать задачу лучше подробно, с указанием, что за систему вы разбираете и на каком основании.

Тем, у кого такая работа основная, дорога одна — программа Daybreak с проверкой личности и организации. Из России она закрыта, как и обычная подписка OpenAI, поэтому для российского читателя практическая часть новости сводится к ложным срабатываниям в ChatGPT и Codex.

Защитники получат доступ последними

Обычно у релиза есть дата, а у Astra её нет. OpenAI говорит про «скоро», про узкий круг альфа-тестировщиков и про постепенное расширение через Daybreak Blue, и в этой последовательности защитники, ради которых модель и подаётся, стоят в очереди позже всех.

Проверочная точка тут одна. Пока Astra не откроют хотя бы верифицированным командам защиты, обещание «эти способности помогут закрывать дыры» остаётся половиной сделки, вторую половину которой отрасль уже получила — сама возможность автоматически собирать цепочку эксплуатации существует и описана в отчёте.

10:15
44
Нет комментариев. Ваш будет первым!