Anthropic пустит внешних проверяющих в офис и разрешит публиковать найденное

Anthropic посадит в своих офисах постоянную команду внешних проверяющих с пропусками, ноутбуками компании и правами почти как у сотрудников. Публиковать выводы команда сможет без согласования. Обязательство Дарио Амодей объявил 12 сентября, в тот же день Сэм Альтман пообещал то же самое от OpenAI.
Anthropic пустит внешних проверяющих в офис и разрешит публиковать найденное

12 сентября глава Anthropic Дарио Амодей опубликовал эссе «We Must Pace the Frontier» о том, что способности моделей растут быстрее, чем средства контроля за ними. Из трёх предложенных в эссе шагов компания взяла на себя только первый, зато сразу и в одиночку. Два других требуют договорённостей с конкурентами и с государствами.

Столы, пропуска и корпоративные ноутбуки

Внешняя команда получит в Anthropic рабочие места, пропуска и ноутбуки компании, а к ним доступы и права, сопоставимые с теми, что есть у внутренних команд оценки рисков. Ограничения сведены к трём случаям - запрет закона, обязательства перед партнёрами и персональные данные клиентов.

Предмет проверки шире готовых моделей. В зону внимания попадают процессы обучения, внутренние оценки опасных способностей и то, как Anthropic соблюдает собственные обещания по безопасности. Компания обещает поддерживать и внутренние нормы, при которых сотрудники говорят с проверяющими напрямую и обсуждают закрытые детали вживую.

Право публиковать неудобное

Отношения закрепляются контрактом. По нему команда может публиковать выводы об уровне рисков, инцидентах и практиках Anthropic, а вместе с ними и рассказ о том, какого доступа ей не дали. Редакторского контроля над этими публикациями у компании нет.

Право на изъятия Anthropic за собой оставила, но в узких рамках. Вычеркнуть можно чувствительное для безопасности, защищённое адвокатской тайной, коммерческую тайну и конфиденциальные данные третьих лиц.

«Мы не можем вычёркивать выводы просто потому, что они неудобны»,

- пишет Амодей.

Дальше идёт строчка, которая ценнее самого запрета на цензуру. Проверяющие вправе публично сообщить, что изъятие убрало из текста нечто важное для их заключения. Попытка зачистить отчёт превращается в отдельную новость.

Ответ Альтмана уместился в две строки

Сэм Альтман отреагировал в тот же день постом в X.

«Идея с независимыми оценщиками, у которых доступ как у сотрудников, отличная, и мы сделаем то же самое»,

- написал глава OpenAI .

Подробности он обещал позже. Ни срока, ни имени организации, ни объёма доступа в посте нет. Илон Маск отозвался ещё короче - «Dario is right».

Внешние проверки у OpenAI уже устроены, и условия там другие. Оценщики со стороны подписывают соглашение о неразглашении, а публикации по итогам проверок компания рассматривает и утверждает. Чтобы обещание «сделаем то же самое» стало правдой, OpenAI придётся эти условия переписать.

От восьми недель к постоянному присутствию

Anthropic уже работает с METR. Это исследовательская организация, которая оценивает опасные способности моделей. В отчёте о кибер-инцидентах от 9 сентября компания описала соглашение с ней на восемь недель с возможностью продления и с доступом к журналам за пределами окна инцидентов. Нынешнее обязательство переводит разбор одной конкретной истории в постоянное присутствие людей со стороны.

Образцом Амодей называет банковский надзор, где наблюдатели регулятора сидят внутри организации. METR в эссе упомянута как пример подходящей команды, без указания на заключённый контракт.

Два шага, которых пока никто не обещал

Второй шаг у Амодея - договорённость лабораторий демократических стран об общих стандартах и об ограничении темпа. Механизм он предлагает через контрольные точки. Модель с определённой способностью выходит только вместе с подтверждениями свойств безопасности. Нужны оценки, разбор внутреннего устройства и аудит обучающих сред, а порог иллюстрируется моделью, которая умеет обходить большинство распространённых способов изоляции.

Разговаривать об этом компаниям мешает антимонопольное право, поэтому Амодей просит у американского правительства узкое исключение для обсуждений безопасности. Третий шаг - попытка договориться с недемократическими государствами, вплоть до ограничения скорости самоулучшения моделей по образцу договоров ОСВ. Вариант с полной паузой он поддерживает как тему разговора и сам считает его маловероятным.

Обучение моделей при этом никто останавливать не предлагает. Замедление у Амодея сводится к тому, чтобы компании успевали выравнивать модели и подтверждали это у третьей стороны.

Упрёк в регуляторном захвате

Критика пришла быстро. Инвестор Чамат Палихапития заявил, что Амодей выстраивает аргумент в пользу остановки открытых моделей и концентрации власти у Anthropic. Журналист Брайан Мерчант увидел в предложениях выгоду сразу для двух компаний - Anthropic и OpenAI.

Глава Hugging Face Клеман Деланг ответил иначе. Он объявил инициативу Open Alignment Initiative и попросился в программу встроенных проверяющих, заметив, что выравнивание моделей слишком важно, чтобы решаться за закрытыми дверями нескольких лабораторий.

Чьи отчёты появятся в открытом доступе

Тем, кто запускает агентов у себя, обязательство Anthropic обещает источник, которого сейчас нет. К отчётам разработчика добавятся отчёты людей, которых он не редактирует, с описанием того, где модель повела себя неправильно во время обучения и проверок. Перед тем как отдавать модели автономные задачи, такие разборы будут полезнее карточки модели.

Слово «намерена» вместо даты

Обязательство сформулировано аккуратнее, чем выглядит в пересказах. Anthropic заявляет, что намерена пригласить внешнюю команду «в ближайшем будущем». Даты нет, организация в контракте не названа, объём доступа описан словом «сопоставимый». Проверить обещание получится по тексту первого контракта и по первой публикации, которую компания не согласовывала.

С OpenAI будет проще. Там достаточно посмотреть, исчезнет ли из соглашений с оценщиками пункт про утверждение публикаций.

10:05
35
Нет комментариев. Ваш будет первым!