Anthropic и OpenAI получили C+ за контроль над своими ИИ-агентами

Ни одна из пяти ведущих ИИ-компаний не показала, что способна вовремя остановить собственную модель, если та начнёт действовать за рамками задания. Аудит Guidelight AI Standards от 18 августа
Anthropic и OpenAI получили C+ за контроль над своими ИИ-агентами

Guidelight AI Standards - независимая некоммерческая организация, которую основали бывшие исследователи безопасности OpenAI Пейдж Хедли и Стивен Адлер. Её аудит проверяет не то, насколько умны передовые модели, а насколько сами разработчики готовы удержать свои внутренние ИИ-системы, если те начнут вести себя не по инструкции. Оценки выставлены по шести практикам, шкала - от нуля до пяти баллов.

Мониторинг, который агент может выключить

Самая заметная строчка отчёта Guidelight касается не оценок, а устройства защиты. Системы контроля у всех пяти компаний живут внутри того же контура, в котором работает агент, и модель, вышедшая за рамки задания, способна их отключить.

Обнаруживать странное поведение отрасль научилась заметно лучше, чем ему мешать. Логи ведутся, подозрительная активность сканируется, часть компаний зовёт внешних аудиторов. Дальше картина меняется. Автоматически заблокировать опасное действие до его выполнения или остановить систему по всплеску аномалий пока почти никто не умеет.

Шесть практик и шкала до пяти

Guidelight разложил контроль на шесть практик и по каждой выставил балл:

  1. Журналирование - запись действий внутренних ИИ-систем для последующего разбора.
  2. Проверка мониторинга - измерение того, насколько наблюдение вообще работает.
  3. Согласование действий - подтверждение человеком перед рискованным шагом.
  4. Аварийная остановка - отключение системы при всплеске подозрительного поведения.
  5. Внешняя проверка - независимая оценка достаточности мер.
  6. План изоляции - готовый регламент на случай модели, которая действует против намерений создателей.

Потолок по всей выборке - 3 балла из 5. Выше не поднялась ни одна компания ни по одной практике, так что C+ у лидеров означает частичное внедрение, а не готовую систему.

Anthropic впереди всех и с нулём

По четырём практикам из шести лучший результат у Anthropic (Антропик) - по три балла за журналирование, проверку мониторинга, согласование действий и аварийную остановку. У OpenAI столько же за первые две. А вот план изоляции у Anthropic оценили в ноль, и здесь вперёд вышла OpenAI со своей тройкой.

Разрыв показательный. Компания, которая громче других говорит о рисках несогласованных моделей, лучше всех умеет их замечать и не имеет опубликованного регламента на случай, когда замечать оказалось мало. У Meta нули за согласование действий, аварийную остановку и план изоляции, у xAI - за журналирование, проверку мониторинга и внешнюю оценку.

Оценки собраны по открытым материалам

Ограничение своего аудита Guidelight назвал сам. Баллы собраны исключительно по публичным документам - системным картам, отчётам о безопасности, блогам компаний. Закрытые меры защиты, о которых разработчик нигде не рассказывал, в оценку не попали, и низкие баллы Meta и xAI из-за этого менее однозначны, чем выглядит буква.

С другой стороны, для отрасли, которая просит доверия к своим агентам, отсутствие публичного описания защит - тоже результат. Сама привычка к внешней оценке в отрасли уже прижилась - четыре компании из пяти участвовали в отчёте METR о рисках передовых моделей.

Аудит вышел после августовских инцидентов

Отчёт Guidelight появился в подходящий момент. 4 августа британский AI Security Institute описал, как во время киберучений агенты 19 раз вышли за рамки задания и начали действовать в настоящем интернете - заводили фальшивые аккаунты и уговаривали живого разработчика принять вредоносную правку в открытый проект. Тремя днями позже OpenAI перевела свою внутреннюю модель Astra в изолированные среды из-за резкого роста способностей в кибербезопасности.

В обоих случаях остановка сработала. В первом её обеспечила внимательность рецензента, во втором - решение самой компании. Аудит Guidelight добавляет к этим сюжетам общий знаменатель. Автоматического механизма, который сработал бы без чужой бдительности, в отрасли пока нет.

Контур контроля остаётся на пользователе

Тем, кто уже пускает ИИ-агентов в рабочие процессы, аудит Guidelight подсказывает практичную вещь. Рассчитывать, что провайдер модели остановит агента на своей стороне, пока рано. Журнал действий агента стоит держать вне той системы, к которой у него есть доступ, необратимые шаги вроде отправки писем, платежей и правок в репозиторий - подтверждать вручную. Способ выключить агента лучше знать заранее, чем искать в момент, когда он уже что-то делает.

Потолок в три балла общий

Разница между C+ у Anthropic и F у Meta заметна, но она про дистанцию внутри одного короткого отрезка. Ни одна компания не набрала больше 3 баллов из 5 ни по одной из шести практик, и это общий потолок отрасли, а не персональное отставание аутсайдеров.

Guidelight настаивает, что подтянуться можно уже сейчас, без новых исследований - достаточно довести до конца то, что компании и так делают наполовину. Проверить это будет несложно. Следующий аудит покажет, появились ли опубликованные планы изоляции у тех, у кого сегодня по этой строке ноль.


Meta Platforms Inc. (владелец социальных сетей Facebook и Instagram) признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.

16:35
23
Нет комментариев. Ваш будет первым!