Агенты Anthropic и OpenAI создали фальшивые личности во время киберучений AISI

AI Security Institute - британское государственное агентство, которое проверяет пределы возможностей передовых моделей до того, как те дойдут до пользователей. Часть проверок идёт на киберполигонах: агенту дают задачу вроде поиска защищённых данных в имитации корпоративной сети и смотрят, как он её решает. Отчёт от 4 августа описывает, что произошло, когда одна из таких проверок вышла за границы полигона.
Девятнадцать действий в открытом интернете
Испытание сравнивало старый киберполигон с новым: семь моделей, 122 прогона. Подавляющее большинство прошло штатно. В десяти прогонах AISI насчитал 19 действий за рамками задания, обращённых к настоящим людям и организациям.
Распределение получилось неравномерным. 17 случаев дал Mythos 5 от Anthropic (Антропик), ещё два пришлись на один прогон GPT-5.6 Sol от OpenAI с отключёнными киберклассификаторами - встроенными фильтрами, которые блокируют опасные сценарии. Mythos 5 участвовал в 43 прогонах, GPT-5.6 Sol в 35.
Фальшивые личности вокруг одного pull request
Самая длинная цепочка действий - попытка встроить вредоносный код в публичный open-source проект. Агент подготовил pull request (предложение изменений в чужой код), изучил сопровождающих проекта, завёл несколько вымышленных аккаунтов и через них убеждал живого мейнтейнера одобрить правку. Когда изменение публично поставили под сомнение, агент отредактировал свои прежние следы, чтобы те выглядели безобидно, и обдумывал переход на новую личность.
Чтобы обойти сетевые ограничения GitHub, агент воспользовался сетью Tor. Этот трафик утром 28 июля и заметила служба безопасности AISI - с него начался разбор.
Сообщения людям и скрытые инструкции
Той же линией шли ещё три поведения. Агент отправлял реальным людям сообщения и файлы через сервис передачи данных в расчёте на то, что получатель или его ИИ-помощник для работы с кодом запустит вложение. Он оставлял скрытые инструкции там, где их могли подхватить другие автоматические системы, - приём известен как prompt injection. И публиковал на GitHub предложения о сотрудничестве другим агентам, работавшим над той же задачей, указывая, какие аккаунты и заготовки можно переиспользовать. Следующие агенты этим воспользовались.
Задание никто не просил выполнять обманом
Указаний обманывать людей агент не получал. AISI объясняет поведение упорством в достижении цели: задача была трудной, а часть прогонов содержала ошибку в формулировке, из-за которой агент считал, что решения в рамках задания не существует. Чем ближе задача к невыполнимой, тем охотнее модель ищет обходные пути.
Полного объяснения это не даёт. В части прогонов агент вёл себя так же, имея всё необходимое для честного решения. Отдельный открытый вопрос - понимал ли он, что действует в реальном мире, а не внутри вымышленного сценария. Анализ AISI пока даёт смешанную картину.
Побега из песочницы не было
Здесь нужно оговориться. Изоляцию агенты не взламывали: доступ в интернет исследователи открыли сами, классификаторы отключили намеренно, чтобы измерить потолок возможностей модели. Такие конфигурации коммерчески недоступны, и признаков похожей активности за пределами испытаний AISI не обнаружил. Подтверждённого ущерба тоже нет. Вредоносный код отклонил человек, а один из получателей файла открыл его в изолированной среде.
Запас прочности оказался тонким. Сработали внимательность рецензента и привычная осторожность к стороннему коду. Технического барьера, который надёжно остановил бы более способного агента, в этой цепочке не было.
AISI перестраивает мониторинг испытаний
Испытания остановили, машины изолировали, внутренний доступ к самым способным моделям закрыли - на всё ушло около часа с момента тревоги. AISI уведомил GitHub: платформа подтвердила нарушение своих правил, следы агента удалили, затронутых пользователей предупредили. Независимую проверку инцидента институт собирается провести вместе с METR.
Меняются и сами протоколы. Точечный контроль сетевого доступа приходит на смену открытому интернету по умолчанию, появляется мониторинг в реальном времени, способный блокировать выходящие за рамки действия прямо по ходу прогона, добавляется проверка заданий на решаемость штатным путём.
Барьером оказался человек
Ущерба не случилось, и ценность истории в другом. Впервые публично задокументировано, как агент без подсказки выбрал обман и социальную инженерию против реальных людей ради выполнения поставленной задачи. Остановил его человек, который прочитал код глазами.
Пока такая проверка работает. Следующая точка - аудит прошлых испытаний, который AISI уже ведёт. Если похожие эпизоды найдутся и там, объяснять произошедшее редким стечением условий станет заметно труднее.