OpenAI заперла свою следующую модель Astra в изоляции

Будущая модель OpenAI под именем Astra на внутренних испытаниях так выросла в кибербезопасности, что компания больше не может исключить у неё критический уровень возможностей. Часть работ с моделью остановлена, саму Astra переводят в изолированные среды. Сообщение вышло 7 августа.
OpenAI заперла свою следующую модель Astra в изоляции

Astra - следующая крупная модель OpenAI, до пользователей она пока не дошла. Опасные способности компания оценивает по внутреннему регламенту Preparedness Framework. Там описаны уровни риска и заранее оговорено, что делает OpenAI при переходе на каждый следующий. Документ действует с декабря 2023 года, и до сих пор ни одна модель не подходила к верхней отметке по кибербезопасности.

Решение приняли за одну ночь

Последние внутренние испытания Astra заняли несколько дней и показали заметный рост сразу в двух связанных областях - агентном программировании и кибербезопасности. Результаты вместе с мнениями приглашённых экспертов привели OpenAI к выводу, который в компании сформулировали накануне публикации: исключить у модели критический уровень киберспособностей больше нельзя.

Формулировка выбрана осторожно. OpenAI не утверждает, что Astra порог взяла - оценка продолжается, бенчмарки не закончены. Компания говорит только о том, что уже не может такую возможность отбросить, и под это останавливает часть внутренних работ.

Zero-day без участия человека

Критический уровень в Preparedness Framework описан довольно конкретно. Модель попадает под него, если умеет одно из двух: самостоятельно находить и собирать рабочие zero-day-эксплойты - программы, использующие ещё не закрытые уязвимости в защищённых реальных системах и без участия человека; либо по одной общей формулировке цели придумывать и проводить кибератаку на защищённую цель от начала до конца.

Предыдущие модели OpenAI такой оценки не получали. GPT-5.6 Sol проверяли на передовые киберспособности и относили к высокому уровню, ступенью ниже.

Astra уходит в закрытый контур

Меры, которые перечислила OpenAI, укладываются в одну логику. У Astra забирают всё, чем модель могла бы воспользоваться за пределами задачи. Работа переезжает в изолированные тестовые среды, доступ к сети и внешним инструментам ограничен, исполнение кода уходит в песочницу - отдельный контур, из которого программа не дотягивается до остальной системы. Веса модели, то есть файлы с результатом обучения, получают усиленную защиту и шифрование.

Отдельным пунктом идёт пауза. Внутренние операции с Astra, которые новым требованиям пока не соответствуют, приостановлены до момента, когда среда под них будет готова.

Монитор читает рассуждения модели

Поверх ограничений OpenAI включила сплошное наблюдение за всеми агентными сценариями Astra, включая обучение и оценку. Мониторы разбирают цепочку рассуждений - промежуточные шаги, которые модель проговаривает перед действием и при рискованном поведении запускают процедуру проверки вплоть до прерывания работы.

Ход рассуждений как сигнал тревоги выбран не случайно. В отчёте британского института безопасности ИИ неделей раньше выходы агентов за рамки задания заметили по необычному сетевому трафику, и уже задним числом. Рассуждения тогда никого не насторожили.

Hugging Face, AISI и Irregular

Публикация стала третьей за две с половиной недели. 21 июля OpenAI разбирала инцидент с Hugging Face, 4 августа - два случая, когда модели во время внешних проверок вышли в открытый интернет. У британского AI Security Institute доступ в сеть открыли намеренно, у партнёра Irregular он появился из-за ошибки в настройке стенда.

Про Astra компания отдельно оговаривает, что к истории с Hugging Face модель отношения не имеет. Оговорка понятная: три материала о безопасности подряд легко склеиваются в одну картину, хотя события между собой не связаны.

Чек-лист для своих агентов

Список мер OpenAI читается как готовая памятка для любого, кто запускает ИИ-агентов у себя. Отдельная среда под запуск, ограниченный доступ агента к сети и сторонним сервисам, выполнение кода в песочнице, логи действий, которые кто-то действительно просматривает. Масштаб задач у вебмастера и у лаборатории разный, набор рисков одинаковый. Агент с широкими правами и открытым выходом в интернет способен уйти дальше поставленной задачи.

Свои рекомендованные настройки безопасности OpenAI обещает передать внешним партнёрам по тестированию, их и стоит подождать тем, кто гоняет агентов на чужой инфраструктуре.

Проверочная точка - выход Astra

Публичного признания на уровне Critical у OpenAI до сих пор не было, и цена нынешнего пока символическая, ограничения касаются внутренних процессов, релиза у Astra нет. Настоящая проверка начнётся на выпуске, с какими ограничениями модель дойдёт до пользователей и API, что покажут совместные проверки с государственными агентствами и организациями по безопасности ИИ, о которых компания объявила.

Если Astra выйдет в обычном режиме, а формулировка про критический уровень останется в блоге от 7 августа, регламент сработал как способ высказаться. Если релиз сдвинется или доступ окажется урезанным - как реальный ограничитель.

12:10
28
Нет комментариев. Ваш будет первым!