Anthropic возвращает Fable 5 после снятия экспортного контроля

30 июня Anthropic сообщила, что власти США сняли экспортный контроль с её новейших моделей Claude Fable 5 и Mythos 5. Ограничение действовало с 12 июня и заставило компанию закрыть доступ к обеим моделям для всех пользователей. Fable 5 возвращается 1 июля - глобально, на Claude.ai, Claude Platform, Claude Code и Claude Cowork.
Anthropic возвращает Fable 5 после снятия экспортного контроля

Anthropic перезапускает Claude Fable 5 после того, как правительство США отозвало экспортные ограничения на неё и на более мощную Mythos 5. Обе модели вышли 9 июня и делят общую основу. Разница в защите: Fable 5 получила самые жёсткие ограничители за всю историю компании и предназначена для широкого доступа, Mythos 5 идёт с меньшим числом ограничителей и раздаётся узкому кругу партнёров программы Project Glasswing для оборонительной кибербезопасности.

Запрет прилетел через три дня после релиза

12 июня власти США ввели экспортный контроль, потребовав закрыть доступ к обеим моделям для всех иностранцев - внутри страны и за её пределами, включая иностранных сотрудников самой Anthropic. Директива вступила в силу мгновенно, а надёжного способа проверять гражданство в реальном времени у компании не было. Пришлось выключить обе модели для всех подряд. 30 июня контроль сняли, 26 июня отдельно разрешили вернуть Mythos 5 ограниченному кругу американских организаций.

Что нашли исследователи Amazon

Поводом для запрета стал отчёт исследователей Amazon. Они подобрали способ обойти защиту Fable 5: заставили модель находить уязвимости в софте, а в одном случае - выдать код, показывающий, как такую уязвимость использовать. Именно эта демонстрация и напугала регулятора.

Anthropic: возможности не уникальны

Две недели компания вместе с правительством и Amazon разбирала отчёт. Вывод Anthropic: те же уязвимости находят и куда более слабые модели - Claude Opus 4.8, GPT-5.5, Kimi K2.7. А демонстрацию эксплойта смогли повторить вообще все протестированные модели, вплоть до Haiku 4.5 и Sonnet 4.6. Уникальных «мифос-возможностей» отчёт не раскрыл, речь шла о пограничном срабатывании защиты на рутинной оборонительной задаче.

Новый классификатор и переброс на Opus

Дыру всё равно закрыли. Anthropic дообучила классификатор безопасности - небольшую вспомогательную систему, которая на лету распознаёт потенциально опасные запросы и блокирует их. Теперь конкретная методика из отчёта Amazon блокируется больше чем в 99% случаев, а заблокированный запрос к Fable 5 автоматически уходит на Opus 4.8. Исследователи CAISI из Минторга проверили и старую, и новую защиту и признали её очень сильной.

Цена решения честно названа в самом посте: классификатор чаще стал цепляться за безобидные запросы при обычном программировании и отладке. Ложные срабатывания - плата за перестраховку, и с ними компания обещает разбираться отдельно.

Один инцидент как повод для отраслевого стандарта

Дальше история выходит за рамки одной модели. Вместе с Amazon, Microsoft, Google и другими партнёрами Glasswing компания начала собирать общий стандарт оценки джейлбрейков - способов обойти защиту ИИ. Идея в том, чтобы измерять серьёзность взлома по четырём критериям: насколько он усиливает атакующего сверх доступных инструментов, для скольких задач работает, сколько усилий нужно, чтобы превратить его в реальную атаку, и легко ли методику вообще раздобыть.

Параллельно Anthropic запускает программу на HackerOne для сдачи найденных джейлбрейков и создаёт команду круглосуточного мониторинга. Плюс углубляет работу с правительством США: ранний доступ регуляторов к моделям до релиза, обмен данными об атаках, совместные исследования. Отсылка идёт к июньскому президентскому указу о развитии и безопасности ИИ.

Кому и на каких условиях

Fable 5 с 1 июля открыта глобально. На тарифах Pro, Max, Team и части Enterprise она до 7 июля включена в подписку с лимитом до 50% недельного объёма, дальше - через кредиты использования. Доступ на AWS, Google Cloud и Microsoft Foundry обещают вернуть по мере готовности. Mythos 5 пока остаётся у отобранных американских организаций, расширение круга идёт через Glasswing.

Из частного бага Anthropic разворачивает большую конструкцию: собственную защиту докрутили, но главную ставку сделали на отраслевые правила и плотную сцепку с государством. Проверочная точка близко - когда стандарт оценки джейлбрейков выйдет из черновика и покажет, готовы ли конкуренты играть по общим меркам. Пока это заявка, а не работающая норма.

19:55
225
Нет комментариев. Ваш будет первым!