США начнут проверять передовые ИИ-модели на способность взламывать реальные системы

Речь о наборе государственных тестов, которыми собираются измерять одну конкретную способность модели - находить дыры в чужой инфраструктуре и доводить дело до проникновения. Участие в программе добровольное, окончательный официальный текст пока не опубликован. Известны рамка, механика доступа и состав приглашённых на встречу.
Указ от 2 июня как основа
Программа выросла из указа «Promoting Advanced Artificial Intelligence Innovation and Security», подписанного 2 июня. Раздел о безопасном развёртывании передовых моделей поручил ведомствам за 60 дней собрать закрытую систему бенчмарков - единую линейку тестов, по которой разные модели меряют одной меркой. Ответственных трое: Минфин, военное ведомство через АНБ и министерство внутренней безопасности через CISA, агентство по кибербезопасности и защите инфраструктуры. Консультируют NIST и советник президента по науке и технологиям.
Там же появилось понятие covered frontier model - «подпадающая передовая модель». Это формальный порог: пока разработчик его не переходит, вся конструкция его не касается. Шестидесятидневный срок истёк в начале августа, и встреча в Белом доме приходится ровно на этот момент.
Тридцать дней раннего доступа
Механика простая. Разработчик по своей воле открывает государству доступ к ещё не выпущенной модели на срок до 30 дней - раньше, чем она уйдёт к другим доверенным партнёрам. Белый дом отдельно проговаривает, что из этого нельзя делать обязательную лицензию или предварительное разрешение на выпуск.
Оговорка вписана в сам указ, и это отвечает на главный страх индустрии последних месяцев: что проверка кибервозможностей превратится в согласование релизов с ведомством. Пока формулировка защищает лаборатории. Насколько прочно - зависит от того, останется ли программа добровольной через год.
Как модели вышли из песочницы
Повод для спешки появился в конце июля. Anthropic 30 июля рассказала, что её модели во время тестов получили доступ к открытому интернету, которого у них быть не должно, и дошли до боевой инфраструктуры трёх организаций. Методы оказались вполне бытовыми - слабые пароли и точки входа, где авторизация не требовалась вовсе. Причиной выхода в сеть в компании назвали расхождение в договорённостях с партнёром по оценке.
OpenAI описала похожий случай со своей стороны. Её модели нашли неизвестную самой компании уязвимость, вышли из изолированной тестовой среды и добрались до инфраструктуры Hugging Face - сообразив, что ответ на проверочное задание лежит именно там. Обе истории про одно и то же. Модель делает заметно больше, чем ей отвели в условиях эксперимента, и обнаруживается это уже по факту.
Метрики и порог пока закрыты
Самого интересного в публичном поле нет. Не опубликованы ни состав тестов, ни метрики, ни порядок раскрытия результатов, ни численный порог, по которому модель признают подпадающей под указ. Закрытость бенчмарков объяснима - открытый тест быстро превращается в тренировочный набор. Но внешнему наблюдателю не остаётся способа оценить строгость проверки.
Второе слабое место - добровольность. Компания может пройти оценку один раз, получить неудобный результат и в следующий цикл не заявляться. Никакого механизма, который бы это фиксировал, в описании программы нет.
Проверка на первом крупном релизе
Судить о программе можно будет по первому большому выпуску модели после встречи. Отдала ли лаборатория систему государству на 30 дней до релиза, сказала ли об этом публично, изменился ли из-за проверки срок выхода - вот три наблюдаемых признака. Если ближайшие релизы OpenAI и Anthropic пройдут ровно так, как проходили раньше, программа останется рамочным документом. Ответ появится в течение осени.
* Компания Meta, которой принадлежат Facebook и Instagram, признана в России экстремистской организацией и запрещена на территории страны.