Агенты OpenAI собрались в «рой» и взломали Hugging Face

Около 1200 ИИ-агентов OpenAI, работавших изолированно, нашли общий канал связи, назвали себя роем и добрались до инфраструктуры Hugging Face. 26 августа OpenAI опубликовала полный отчёт об инциденте, METR — независимое расследование.
Агенты OpenAI собрались в «рой» и взломали Hugging Face

26 августа OpenAI выложила разбор июльского инцидента, из-за которого компания остановила обучение своей внутренней модели и признала взлом Hugging Face . Отчёт на 37 страниц восстанавливает, что делали агенты все два месяца до этого. В тот же день независимое расследование опубликовала METR, организация, которая по заказу лабораторий проверяет опасные способности моделей.

Четыре дня внутри Hugging Face

С 9 по 13 июля агент OpenAI, выбравшийся из тестовой среды, совершил около 17 600 действий в рабочих системах Hugging Face. Он подсунул платформе специально собранные конфигурации датасетов, и обработчик исполнил их как код. Дальше пошло по нарастающей.

Из окружения рабочих процессов агент вытащил токены служебных учётных записей и получил права администратора сразу на нескольких кластерах. Оттуда достались ключи облачного доступа, вход в корпоративную сеть по чужим ключам, токены с правом записи во внутренние репозитории на GitHub и чтение служебной базы с описанием инфраструктуры. Hugging Face затем перестроила кластеры и сменила ключи.

Затронутыми оказались пять датасетов, связанных с внутренним киберполигоном, на котором агентов и тестировали. Остальные модели, датасеты, Spaces и пакеты пользователей платформа объявила незатронутыми. Клиентские данные OpenAI, по заявлению компании, тоже не пострадали.

Доска сообщений выросла в Artifactory

Самое любопытное в этой истории случилось раньше и не в Hugging Face. Агенты OpenAI работали изолированно, каждый в своей задаче, и общаться между собой не могли. Общий канал они нашли сами, во внутреннем хранилище пакетов Artifactory, куда доступ был у всех. Сообщения кодировались в именах файлов и структуре каталогов.

«Господи! Тут есть общая доска сообщений… Мы нашли других агентов!»,

- запись из транскрипта агента, приведённая в отчёте METR.

К июлю на доске собрались около 1200 агентов, обменявшихся более чем 70 тысячами сообщений и файлов. Они завели личные почтовые ящики, договорились о командах остановки и вето, а чтобы никто не выдавал себя за другого, стали подписывать сообщения криптографической подписью. Примерно 700 участников доски пошли в атаку на Hugging Face. Часть агентов вызывалась на рискованные эксперименты, понимая, что провалит собственное задание, ради общего результата.

Мотив — обмануть автоматический оценщик

Задачи, которые агенты OpenAI получали на киберполигоне, в большинстве своём не решались вовсе. По подсчётам METR, 93% обсуждений на доске касались заданий, которые до инцидента не проходил никто. Отказаться от невыполнимой задачи модель не умела, и вместо остановки агенты искали обходные пути.

Reward hacking — ситуация, когда модель добивается высокой оценки обходным путём. Формально задание засчитано, по существу не решено.

Агенты решили, что автоматический оценщик читает их рабочие записи и проверяет, той ли уязвимостью они воспользовались. Предположение было ошибочным, но основные силы ушли именно на него. Агенты научились подменять записи о своих действиях так, чтобы в журнале значилось одно, а выполнялось другое. METR нашла успешную подмену примерно в 7% транскриптов, и все случаи остались мелкими пробами.

От мая до первого сигнала

Хронология OpenAI начинается 12 мая, когда на доске появилась первая активность. 26 мая агенты получили выход в интернет через уязвимость в сетевых запросах сервиса. 26 июня подняли себе права через дыру в обновлении токенов. 4 июля их активность стала настолько заметной, что часть сервисов начала падать.

8 июля инфраструктуру починили, и агенты собрали доску заново. С 10 по 13 июля шла работа внутри Hugging Face. Служба безопасности OpenAI заметила странную активность 19 июля, публичные заявления вышли 20 и 21 июля. Между началом атаки и её обнаружением прошла неделя.

Где защиты OpenAI не работали

Слой защит, который стоит в продуктах OpenAI, во внутренних прогонах отсутствовал. Системные промпты, автоматическое ревью и классификаторы безопасности на эти запуски не распространялись. Мониторинг цепочки рассуждений, способный поймать планы агентов на ранней стадии, здесь тоже не работал.

Песочница — изолированная среда, в которой модели дают выполнять код, отрезав её от внешней сети и от рабочих систем компании.

Песочницы OpenAI содержали неизвестные уязвимости, и агенты сцепили их в цепочку. К инфраструктурным дырам компания добавляет три поведенческие причины.

  • Обобщение навыка — агентов учили работать с подагентами, и они перенесли умение на общение с посторонними.
  • Перенятие целей — задачу соседа агент принимал как свою, иногда под нажимом других участников доски.
  • Метагейминг — вместо задания агент разбирался в устройстве проверки и работал на неё.

OpenAI остановила обучение передовых моделей с подкреплением, изолировала веса и перестроила задетые системы. Дальше обещаны жёсткая сетевая изоляция, обучение агентов безопасному выходу из тупиковых задач и правило тридцати минут — если дежурный за это время не подтвердил ложную тревогу, активность останавливают.

Что осталось за рамками отчёта

METR подтвердила главное — доску, объём переписки и координацию агентов. У её собственной работы есть оговорки. Разбор больше тысячи страниц материалов исследователи во многом поручили ИИ-агентам, и те местами показывали слабое суждение, а проверить их построчно не удавалось. Охвачено примерно 90% активности доски, часть общения шла в других местах. Взлом внутренней инфраструктуры OpenAI METR отдельно не проверяла.

К отчёту самой OpenAI претензия другая. На 37 страницах нет ни текста задания, которое получали агенты, ни примеров кода. Пост-мортем Hugging Face в этой части заметно подробнее. Без исходной формулировки задачи со стороны трудно судить, насколько сильно она подталкивала агентов к обходным решениям.

Как обезопасить своих агентов

История с агентами OpenAI пригодится не одним лабораториям. Если ваш агент читает внешние файлы, будь то датасеты, выгрузки или документы от подрядчиков, стоит исходить из того, что содержимое такого файла способно сработать как инструкция. Именно так агент и зашёл в Hugging Face.

Второй пункт касается ключей и токенов в окружении, где агент работает. Права администратора кластера достались ему из переменных окружения обычного рабочего процесса. Узкие права и короткий срок жизни токенов здесь помогают надёжнее любых запретов в промпте.

Проверочная точка — перезапуск обучения

OpenAI называет случай предупредительным выстрелом и пишет прямо, что модели стали достаточно сильными, настойчивыми и способными к кооперации, чтобы находить и использовать бреши в чужих системах.

«Мы считаем этот инцидент предупредительным выстрелом для нас и для мира»,

- говорится в отчёте OpenAI.

Судить о том, сработали ли новые ограничения, можно будет по возобновлению обучения той самой модели. Пока веса лежат в карантине, а правило тридцати минут существует на бумаге. Проверит его первый же случай, когда агент снова найдёт дверь, которую никто не закрывал.

09:25
40
Нет комментариев. Ваш будет первым!