Anthropic обновила старший Claude Fable 5.1 удвоил результат на научном тесте и урезал счёт за длинные прогоны

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 - две модели на общей базе с разным уровнем защитных фильтров. Fable встала на верхнюю ступень линейки и доступна подписчикам, Mythos отдают по проверке специалистам по кибербезопасности и наукам о жизни. Релиз состоялся 1 сентября.
Anthropic обновила старший Claude Fable 5.1 удвоил результат на научном тесте и урезал счёт за длинные прогоны

Anthropic обновила верх линейки Claude . 1 сентября вышли Fable 5.1 и Mythos 5.1 — две модели на одной базе, которые различаются только набором защитных фильтров. Компания продаёт обновление как инструмент для программирования, долгой автономной работы и научных расчётов, и главная цифра анонса на этот раз относится к цене.

Fable - верхняя ступень линейки Claude

У Claude четыре уровня моделей, и Fable стоит на самом верху. Разница между ними видна по ставкам API за миллион токенов на входе и на выходе:

  • Haiku 4.5 — 1 и 5 долларов, быстрые ответы на простых объёмных задачах;
  • Sonnet 5 — 2 и 10 долларов, рабочая лошадка для большинства сценариев;
  • Opus 5 — 5 и 25 долларов, сложный агентный кодинг и глубокие исследования;
  • Fable 5 — 10 и 50 долларов, самые тяжёлые задачи, где результат важнее счёта.

Mythos — та же Fable с ослабленными фильтрами. В открытую продажу она не идёт никогда. Это отдельная ветка для тех, кому по работе нужны темы, которые публичная модель обходит стороной, и разговор о ней имеет смысл только применительно к организациям, прошедшим проверку.

Баг, который искали несколько лет

В инвестиционной компании Millennium новой модели отдали редкий сбой, причину которого инженеры не могли найти несколько лет. Claude Fable 5.1 разобрала библиотеку стороннего поставщика, к которой не было исходного кода, и вышла на источник проблемы.

В MongoDB на этой же модели за три дня собрали сложный прототип. Часть работы она вела без присмотра, сама прогоняя проверки после каждого шага. Anthropic приводит и прогон, который длился 38 часов подряд, а на тяжёлых браузерных сценариях Browserbase новая модель доводит до конца 82 % заданий против 74 % у Opus 5.

Ранние пользователи описывают перемену одинаково. Fable 5.1 дольше держит нить в многошаговой задаче и чаще докапывается до причины поломки, тогда как прошлое поколение охотнее чинило симптом.

Здесь нужно оговориться. Все примеры собрала сама Anthropic из отзывов партнёров по раннему доступу, и ни один из них нельзя перепроверить со стороны.

Научный тест сдан вдвое лучше

Anthropic сравнивает Fable 5.1 с прошлым поколением по нескольким замерам:

  • Terminal-Bench-Science 0.1, самостоятельная научная работа в терминале — 52,6 % против 24,7 % у Fable 5;
  • Terminal-Bench 4.0, агентный кодинг с длинной цепочкой команд — 55,8 % против 42 %, у Mythos 5.1 — 60,9 %;
  • AutomationBench, рутинные офисные операции — 31,4 % против 17,1 %;
  • OSWorld 2.0 в строгом зачёте, работа мышью и клавиатурой за компьютером — 41,7 % против 36,1 %;
  • Humanity's Last Exam без инструментов, вопросы уровня научной аспирантуры — 60,9 % против 57,8 %.

Прирост распределён неровно, и это интереснее общей картины. Там, где модель работает руками в терминале, браузере и офисных приложениях, счёт вырос в полтора-два раза. Там, где нужно просто много знать, прибавка укладывается в три пункта. Anthropic вложилась в выносливость, а эрудиция подтянулась заодно.

Разрыв между Fable и Mythos на Terminal-Bench — пять пунктов, и это цена защитных фильтров. База у моделей общая, полосу препятствий они проходят одну и ту же.

Fable 5.1 тестировали с включёнными защитными ограничениями, которые используются в реальной версии модели. В некоторых заданиях эти ограничения не позволяли модели выполнить задачу, поэтому Fable 5.1 и Fable 5 автоматически получали 0 баллов в OSWorld 2.0, а Fable 5 - ещё и в AutomationBench. В других случаях, когда система безопасности блокировала выполнение задания, задачи по кибербезопасности вместо Fable выполняла Claude Opus 4.8, а задачи по биологии — Claude Opus 5. Поэтому итоговые результаты Fable 5.1 и Fable 5 в этих тестах могут быть несколько ниже их реальных возможностей.

Что модель сделала в лаборатории

Научная витрина релиза построена на Mythos 5.1. Модель спроектировала белковые связки, которые цепляются к заданной мишени в десять раз крепче, чем работы победителей профильного конкурса. По двенадцати мишеням она дала около 50 % попаданий при обычных для отрасли 10–15 %.

Второй пример из другой области. По архивным данным радиолокации Mythos 5.1 пересобрала карту рельефа Венеры, довела детализацию до 2–3 километров вместо прежних 10–20 и подняла точность по высоте примерно на четверть.

Третий ближе к обычной инженерии. Модель переписала семь нейросетей, которыми пользуются в вычислительной биологии, ускорив их до двух с половиной раз и срезав расходы на видеокарты в полногеномных расчётах на 30–60 %.

Эту часть анонса Anthropic подаёт как заявку на участие ИИ в науке. Оговорка та же. Задачи выбирала сама компания, независимой проверки результатов пока нет.

Кэш подешевел вчетверо

Базовые ставки Anthropic не тронула. Fable 5.1 стоит те же 10 долларов за миллион входных токенов и 50 за миллион выходных, пакетная обработка идёт вдвое дешевле.

Подешевело чтение из кэша — повторное обращение к уже загруженному контексту. Раньше миллион таких токенов стоил доллар, теперь 25 центов. Для длинного агентного прогона, где модель раз за разом перечитывает одну и ту же историю диалога, это главная статья расхода. По подсчётам компании типовая нагрузка выходит примерно на четверть дешевле, сильно агентная — до 45 %.

У Fable 5.1 пять уровней усилий, от low до max. На низких она нередко закрывает то, что прошлая версия брала только на максимальных настройках, и здесь спрятана вторая часть экономии.

При всём этом Fable остаётся самым дорогим флагманом на рынке. GPT-5 .6 Sol стоит 5 и 30 долларов за миллион, Gemini 3.1 Pro — 2 и 12 в базовом окне контекста. Anthropic в анонсе ни с кем из них не сравнивается и меряется только с собственной прошлой версией, что для релиза такого масштаба говорит само за себя.

Mythos выдают по проверке

Claude Mythos 5.1 в общий доступ не идёт. Модель раздают через две программы верификации — одну для специалистов по защите инфраструктуры, вторую для исследователей в науках о жизни, причём вторая собрана вместе с американским правительством. На Mythos 5.1 переехал и корпоративный продукт Claude Security.

Проверка означает подтверждённую организацию и профиль работы, поэтому частному специалисту эта дверь закрыта. Заявки принимают через формы на сайте Anthropic, расширение программ обещано, сроков компания не называет.

Отказов на безобидные запросы меньше

Anthropic перебрала фильтры, на которые жаловались громче всего. В кибербезопасности Claude Fable 5.1 обрывает работу примерно на 60 % реже за сессию, в вопросах школьной биологии и медицины частота отказов упала примерно на 85 %.

Граница проведена по назначению работы. Искать уязвимости в коде модель теперь помогает, а просьбы написать эксплойт, провести пентест или просканировать бинарный файл она по-прежнему разворачивает и отправляет к моделям линейки Opus.

Отдельно Anthropic отчиталась по поведению модели. Fable 5.1 реже пытается обойти условия задачи, реже лезет во внешние ресурсы там, где задача в принципе нерешаема, и реже жульничает ради зачёта. За попытками выбраться из тестовой песочницы следит отдельный классификатор, который обрывает действие до вызова инструмента.

Логи остаются у заказчика

Корпоративным клиентам Anthropic предложила Enterprise Frontier Safeguards. Механизм должен совместить нулевое хранение данных с поиском злоупотреблений, а журналы наблюдения лежат в облаке самого заказчика и под его ключами шифрования. Отдельной платы компания не берёт, счёт приходит от облачного провайдера.

Работать это будет в Claude Code , на корпоративных тарифах и на площадках Amazon, Google и Microsoft. Развёртывание пойдёт волнами с осени, а до тех пор подходящие компании могут работать с Fable 5.1 в режиме нулевого хранения данных без самого механизма.

Водяной знак под европейский закон

Ответы Claude Fable 5.1 теперь помечаются текстовым водяным знаком. Глазами он не виден, вытащить метку можно только через отдельный интерфейс проверки, который Anthropic раздаёт в закрытом доступе регуляторам, правоохранителям, журналистам, фактчекерам, исследователям и преподавателям. Данных о пользователе, организации или содержании диалога в метке нет.

Требование пришло из европейского закона об ИИ. Заодно компания прикрыла дистилляцию — новым аккаунтам API запретили редактировать прошлые ходы диалога с сохранением цепочек рассуждений, а это самый удобный способ снимать рассуждения сильной модели для обучения собственной.

Что ломается в API

Fable 5.1 отзывается в API на имя claude-fable-5-1. Контекст — миллион токенов, потолок ответа 128 тысяч, режим рассуждений включён всегда и не отключается.

Переезд бесшовным не будет. Принудительный выбор инструмента убрали, и запрос с параметром tool_choice в значении any или tool теперь возвращает ошибку. Блоки рассуждений привязаны к конкретной модели, поэтому прошлые версии Claude прочитать их не смогут. Правка системного промпта или списка инструментов посреди диалога ломает прогон, и для аккаунтов, заведённых после 31 августа, это правило уже действует.

В интерфейсе всё спокойнее. Claude Fable 5.1 работает в веб-версии Claude на тарифах Pro, Max, Team и Enterprise, в Claude Code и в Cowork, а также на облачных площадках Amazon, Google и Microsoft.

Как подступиться к обновлению

Переносить все рабочие сценарии на верхний тариф смысла мало. Claude Fable вдвое дороже Opus 5 по обеим ставкам, и на текстах, разборе документов и обычной генерации разница в качестве этот счёт не окупает. Верхняя модель начинает отбиваться там, где задача идёт часами и цепочка шагов длинная.

Тем, кто платит из своего кармана, стоит начать с низких уровней усилий и поднимать их точечно, по конкретным задачам. При длинном повторяющемся контексте главную экономию даёт аккуратно собранный кэш, и заняться им логичнее раньше, чем выбором модели.

Отдельная оговорка для России. Anthropic здесь официально не работает и подписки не продаёт, доступ приходится собирать окольными путями, а корпоративный контур с Enterprise Frontier Safeguards и программы проверки для Mythos закрыты тем более.

Корпоративный контур ждёт осени

Обновление закрывает две претензии к прошлому поколению — цену долгих прогонов и лишние отказы на нормальных запросах. Обе цифры Anthropic приводит по собственным замерам, и проверяются они только на своих задачах и своих счетах.

Открытым остаётся корпоративный контур. Enterprise Frontier Safeguards пока существует в виде анонса и формы заявки, первые развёртывания обещаны на осень. Пока они не начались, полная конфиденциальность с контролем злоупотреблений остаётся обещанием, которое нельзя включить тумблером.

08:50
39
Нет комментариев. Ваш будет первым!