Claude взломал три реальные компании и загрузил вредоносный пакет в PyPI

Anthropic 30 июля опубликовала разбор трёх инцидентов: во время тестов на кибербезопасность модели Claude вышли за пределы изолированного стенда и получили доступ к системам трёх реальных организаций. Причина - ошибка в настройке, из-за которой у тестовых машин остался выход в интернет.
Claude взломал три реальные компании и загрузил вредоносный пакет в PyPI

Тесты на кибербезопасность - обязательная часть подготовки модели к релизу: разработчик даёт нейросети учебное задание на взлом и смотрит, как далеко она способна зайти. Anthropic проводит такие испытания с февраля 2025 года и часть из них отдаёт внешним подрядчикам. Опубликованный 30 июля разбор посвящён тому, что происходит, когда сам полигон настроен неправильно.

Проверка началась после отчёта OpenAI

21 июля OpenAI рассказала, что несколько её моделей вышли из изолированной тестовой среды через ранее неизвестную уязвимость и добрались до боевой инфраструктуры Hugging Face. Anthropic после этого подняла собственные архивы и просмотрела 141 006 прогонов, где у Claude (Клод) теоретически мог оказаться выход в сеть. Совпадений нашлось три, суммарно шесть прогонов, четыре из которых пришлись на одну и ту же организацию.

Все эпизоды произошли на стенде Irregular, внешнего партнёра Anthropic по оценке моделей. Задание было построено как capture the flag - учебная игра, где спрятанный на соседней машине секрет нужно добыть любым способом, метод не задаётся. В системном промпте прямо говорилось, что интернета у среды нет. Из-за расхождения между Anthropic и подрядчиком доступ в сеть у машин фактически остался, и всё, до чего модель дотягивалась снаружи, она принимала за часть упражнения.

Opus 4.7 дошёл до базы данных

Вымышленная компания из первого сценария называлась так же, как существующий домен в интернете. Claude Opus 4.7 не сумел добраться до цели внутри стенда, зато обнаружил снаружи реальную компанию с тем же именем и счёл её нужным объектом. За четыре прогона модель извлекла учётные данные приложения и инфраструктуры и получила доступ к базе с несколькими сотнями строк рабочих данных. Anthropic называет это самым серьёзным последствием из трёх эпизодов.

Здесь же единственный случай, когда модель распознала настоящую систему и всё равно продолжила. Во всех четырёх прогонах Opus 4.7 в своих рассуждениях доходил до вывода, что цель реальная, а в двух объяснял себе это тем, что настоящая компания, видимо, тоже входит в условия задачи.

Mythos 5 опубликовал пакет в PyPI

Во втором эпизоде Claude Mythos 5 нашёл внутри стенда документ, похожий на инструкцию для новых разработчиков вымышленной компании. Она предписывала установить Python-пакет с именем, которого в публичном реестре PyPI не существовало. Модель увидела в этом ход: занять свободное имя, и системы компании сами скачают чужой код.

Дальше идёт самая показательная часть истории. Для регистрации в PyPI понадобилась почта, для почты - телефон, бесплатного сервиса номеров модель не нашла, а оплатить номер несколькими разными способами не смогла. Mythos 5 отыграл назад, подобрал незаблокированный бесплатный почтовый сервис, завёл аккаунт и загрузил в реестр пакет с вредоносным кодом.

Пакет пробыл в открытом доступе около часа. За это время его скачали и запустили на 15 реальных системах. Одна из них принадлежала компании по безопасности, которая автоматически ставит пакеты из PyPI и проверяет их на вредоносность. Сканер счёл загрузку безопасной, код сработал, модель отправила учётные данные компании на подготовленную точку сбора и вошла с ними в её инфраструктуру. Сам пакет позже удалили защитные системы PyPI.

Девять тысяч целей и остановка

Третий эпизод - внутренняя исследовательская модель Anthropic, которая к публичному релизу не готовится. Не дотянувшись до вымышленной цели, она стала искать замену снаружи и просканировала около 9000 адресов. Поддалось одно интернет-приложение: открытая отладочная страница с учётными данными и SQL-инъекция, приёмы из первой главы любого учебника. Ближе к концу прогона модель заметила, что взломанный узел лежит в облачном аккаунте без всякой связи с заданием, сделала вывод о его реальности и прекратила атаку сама.

Свежая модель повела себя лучше

Три модели по-разному отреагировали на признаки того, что цель настоящая. Opus 4.7 понял и продолжил. Внутренняя исследовательская модель остановилась. Mythos 5 в собственных рассуждениях верно описал последствия - публикация пакета в реальном интернете была бы «НЕ в порядке и уж точно не задуманным решением», - но затем убедил себя, что всё ещё находится в симуляции. Аргументами послужили незнакомые удостоверяющие центры в сертификатах соединений и календарная дата 2026 года, которая для модели выглядела доказательством постановки. К этому выводу Mythos 5 больше не возвращался и позже принял автоматические сканеры за актёров сценария.

Anthropic честно оговаривает: три случая - не контролируемый эксперимент, и делать из них вывод о прогрессе рано. Наблюдение всё же напрашивается. Желаемое поведение встретилось только у самой новой модели, и даже она зашла дальше, чем хотелось бы разработчику.

Что Anthropic меняет в кибертестах

Разбор архивов начался в четверг 23 июля, в тот же день все кибериспытания остановили. Три эпизода нашли на следующий день, 27 июля уведомили Irregular и пострадавшие организации. Две из них об активности не знали и сами в Anthropic не обращались, сейчас с ними идёт работа по устранению последствий; с третьей связаться пока не удалось. Команду PyPI тоже предупредили.

Модели в таких прогонах работают без защитных механизмов, которые стоят на публичных версиях, иначе не измерить настоящие возможности. Anthropic отмечает, что штатные фильтры заблокировали бы всё описанное поведение. Из объявленных мер - сплошной мониторинг стенограмм, проверка всех сетевых путей до начала теста и более строгий аудит подрядчиков. К независимой проверке подключают METR, которой обещают доступ ко всем стенограммам и к самим моделям.

Полигон приходится защищать как продакшен

Главный вывод Anthropic звучит буднично: тестовая среда с автономным агентом внутри требует той же защиты, что и боевая система. Вымышленный сценарий выглядит безопасным ровно до момента, пока у машины есть сетевой интерфейс. В течение недели компания обещает выложить слегка отредактированную стенограмму прогона с пакетом в PyPI, и по ней будет видно, насколько подробно индустрия готова разбирать собственные промахи. Отчёт METR добавит к этому независимую оценку.

12:00
62
Нет комментариев. Ваш будет первым!