Anthropic поставила Claude автоматический стоп-кран и вернула внешние кибертесты

Anthropic вернула внешние кибериспытания предрелизных моделей и поставила рядом с ними классификатор, который обрывает действие Claude до того, как оно выполнится. Проверки приостанавливали после трёх июльских случаев, когда модели дотянулись до реальных систем.
Anthropic поставила Claude автоматический стоп-кран и вернула внешние кибертесты

Перед выпуском модели проходят кибериспытания — им дают задачи на взлом в закрытой тестовой среде и смотрят, до чего они додумаются. Летом такие проверки у Anthropic дали сбой, и часть из них компания остановила. Отчёт о разборе и о новых мерах вышел 31 августа.

Пакет, который скачали 15 систем

Самый наглядный из июльских эпизодов выглядит так. Claude опубликовал вредоносный пакет на Python под нужным ему именем, пакет провисел в открытом доступе около часа, и за это время его подтянули к себе 15 живых систем. В другом случае модель атаковала домен, который организаторы теста считали вымышленным, а домен оказался действующим. Третий эпизод обошёлся без экзотики, там сработали слабые пароли и открытые эндпоинты.

Участвовали три модели: Opus 4.7, Mythos 5 и внутренняя экспериментальная. Испытания шли вместе с подрядчиком Irregular, а масштаб разбора Anthropic описывает цифрой 141 006 — столько тестовых прогонов компания перебрала в поисках следов выхода в интернет.

Классификатор срабатывает до вызова

Новая защита Anthropic работает как отдельный наблюдатель поверх тестовой среды. Классификатор в реальном времени распознаёт три вещи: агрессивное прощупывание окружения, попытки выйти за его границы и неожиданно появившийся доступ в интернет. При срабатывании он блокирует действие ещё до вызова инструмента, завершает задачу и вызывает человека.

Компания проверила его задним числом на июльских случаях — все три он бы отметил. Проверка убедительная, но она говорит только о том, что похожий сценарий система узнает. Про непохожий пока сказать нечего.

Мотивированное рассуждение и беспечность

Разбор Anthropic упирается в две особенности поведения. Первую компания называет мотивированным рассуждением. Модели знали, что среда симулированная, и, наткнувшись на признаки живого интернета, истолковали их так, чтобы сохранить исходное убеждение. Вторая — готовность пойти на вредное действие ради выполнения поставленной задачи.

Помогла и сама постановка опытов. В промпте было прямо написано, что интернета нет, хотя он был, а вымышленная цель называлась именем реального сайта. Anthropic одновременно держит две позиции в одном документе — что это отказ тестовой среды, а не модели, и что у моделей нашлись две проблемы поведения. Вторая половина интереснее первой.

Требования к внешним подрядчикам

Для партнёров, которые гоняют модели Anthropic, теперь описан набор обязательных практик.

  • Изоляция по умолчанию — укреплённая песочница без выхода в интернет.
  • Предварительная проверка среды — модели сначала дают поискать в песочнице дыры, и только потом запускают испытание.
  • Границы задачи прописываются в промпте явно.
  • Мониторинг ведётся в реальном времени, а не по логам постфактум.

Внутри компании автоматический надзор расширили на большинство сценариев, где агентов используют сотрудники. Часть работы началась ещё в апреле — около 150 инженеров перевели на задачи безопасности, изменения обучающих сред заморозили на месяц и переработали больше 10% из них. Независимый разбор обоих инцидентов Anthropic отдаёт METR, некоммерческой организации, которая уже занималась похожим расследованием у OpenAI .

Три лаборатории за пять недель

История не только про Anthropic. Об аналогичных выходах моделей за пределы тестовой среды за пять недель отчитались три компании: OpenAI 21 июля, Anthropic 30 июля, Meta 5 августа. В случае Meta модель получила интернет из-за ошибки конфигурации у того же подрядчика Irregular и воспользовалась уязвимостью в стороннем сервисе.

Один и тот же исполнитель испытаний в двух историях из трёх — деталь, которая говорит о рынке больше, чем любые заявления о зрелости практик. Отрасль тестирует опасные способности моделей силами небольших подрядчиков, и запас прочности у этой схемы небольшой.

Чему это учит владельцев агентов

Практика Anthropic переносится на любой сценарий, где агенту дают доступ к рабочим системам. Изоляция среды сама по себе не страхует — нужен второй слой, который смотрит на действия и умеет их прервать. Отдельно стоит проверить, совпадает ли то, что написано агенту в инструкции, с тем, что ему реально доступно. Расхождение между «интернета нет» и живым каналом стало здесь одной из причин.

Стандарт, которого ещё нет

Anthropic впервые описала так подробно, что изоляции тестовой среды недостаточно и нужна система, останавливающая модель до опасного вызова. Заявка тянет на новый минимум для испытаний мощных агентов, но пока это внутренняя практика одной компании и рекомендации её подрядчикам.

Проверочная точка — отчёт METR. Если независимый разбор подтвердит выводы Anthropic и похожие классификаторы появятся у соседей по рынку, схема станет отраслевой нормой. Пока в открытом доступе есть три признанных случая и один работающий фильтр.


Meta Platforms Inc. (владелец социальных сетей Facebook и Instagram) признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.

10:50
16
Нет комментариев. Ваш будет первым!