Anthropic выпустила Claude Opus 5 - уровень Fable 5 за полцены

Anthropic 24 июля выпустила Claude Opus 5 - модель, которая обходит флагманский Fable 5 на большинстве тестов по коду и профессиональной работе и стоит вдвое дешевле. Цена осталась прежней, на уровне Opus 4.8, доступ открыт сразу на всех платформах.
Anthropic выпустила Claude Opus 5 - уровень Fable 5 за полцены

Claude Opus 5 - новая верхняя модель в линейке Opus, рассчитанная на долгую агентную работу: код, анализ, документы, задачи в несколько шагов, которые выполняются часами. Anthropic называет её самой выровненной моделью за всю свою историю, а сам релиз подаёт через экономику: интеллект почти на уровне дорогого Fable 5 при цене прежней Opus 4.8. Доступ открыли в день анонса, на платных тарифах Claude и в API.

Цена осталась на уровне Opus 4.8

Opus 5 стоит $5 за миллион входных токенов и $25 за миллион выходных, ровно столько же, сколько предыдущая версия. Anthropic строит подачу релиза вокруг собственной линейки: Opus 5 сравнивают с дорогим флагманом Fable 5, к которому новинка подошла по интеллекту, оставаясь вдвое дешевле. Ход понятный - давить на цену чужих моделей сложнее, чем показать разрыв внутри своего же прайса.

В API модель называется claude-opus-5, работает также через Amazon Bedrock, Google Cloud и Microsoft Foundry. На тарифе Claude Max - Opus 5 стала моделью по умолчанию, на Claude Pro - самой сильной из доступных. Есть и Fast mode: примерно в 2,5 раза быстрее обычного режима за двойную базовую цену.

Frontier-Bench, ARC-AGI и OSWorld

Результаты Anthropic показывает в связке с затратами. У каждой модели на графиках своя кривая «стоимость задачи против качества». Главный аргумент компании в том, что кривая Opus 5 лежит выше конкурентов почти на всём диапазоне.

Результаты Anthropic

Заявленные результаты:

  • Frontier-Bench v0.1 (сборка работающего софта по инженерным чертежам) - обходит все модели и больше чем вдвое перекрывает результат Opus 4.8 при меньшей стоимости задачи.
  • CursorBench 3.2 - на максимальном уровне усилий отстаёт от пикового результата Fable 5 на 0,5% при половинной стоимости.
  • ARC-AGI 3 (задачи, которых модель раньше не видела) - втрое выше ближайшего конкурента.
  • Zapier AutomationBench (бизнес-задачи от начала до конца) - примерно в 1,5 раза больше пройденных задач при той же стоимости; даже на минимальном уровне усилий проходит больше, чем любая другая модель.
  • OSWorld 2.0 (управление компьютером) - превосходит лучший результат Fable 5, потратив чуть больше трети его стоимости.

Подтянулись и естественные науки: на всех внутренних тестах Anthropic по биологии и химии Opus 5 обошла Opus 4.8. Самый заметный рост в органической химии, где по спектроскопическим данным нужно восстановить структуру молекулы, - плюс 10,2 процентных пункта. Предсказание того, как мутации в последовательности белка меняют его работу, дало плюс 7,7 пункта.

Модель доводит задачу до конца

Главное изменение в поведении, о котором говорит Anthropic, - модель перепроверяет себя и не останавливается на первом рабочем варианте. Три примера из тестов и раннего доступа показывают, как это выглядит.

В одной задаче Frontier-Bench модель получила чертёж детали и просьбу собрать по нему 3D-модель в FreeCAD, но возможности посмотреть на чертёж её намеренно лишили. Opus 5 написала себе конвейер компьютерного зрения, вытащила геометрию из пикселей и собрала деталь. Ни одна конкурирующая модель в тех же условиях не справилась за пять попыток.

Второй случай - реальный баг в популярном пакетном менеджере. Opus 5 нашла первопричину и закрыла краевой случай, который пропустил патч сообщества; конкурирующая модель починила внешний симптом и отчиталась об успехе. Третий - инженер трейдинговой фирмы за одну сессию собрал с Opus 5 приём рыночных данных с новой биржи. Живого потока для проверки не было, и модель построила себе тестовый стенд.

Самая выровненная модель компании

По внутреннему автоматическому аудиту Opus 5 получила 2,3 балла по доле ответов, расходящихся с заявленными принципами Claude, - меньше, чем Opus 4.8, Sonnet 5 и Fable 5. Anthropic отмечает самый низкий уровень попыток ввести пользователя в заблуждение и лучшую устойчивость к обманным запросам. Плюс осторожность в действиях с необратимыми последствиями, что для агентов с доступом к рабочим системам важнее любого балла на бенчмарке.

Находит уязвимости, эксплойты не пишет

Opus 5 намеренно не обучали на кибербезопасности, но с общим ростом способностей она подтянулась и здесь. В тесте OSS-Fuzz модель почти догнала Mythos 5 в поиске уязвимостей в коде, а в написании работающих эксплойтов остаётся далеко позади. Anthropic подаёт разрыв как результат осознанного выбора, и в такой формулировке он выглядит удобно: сильная модель для защиты, слабая для атаки.

Фильтры для киберзапросов у Opus 5 мягче, чем у Fable 5. По оценке компании, срабатывают примерно на 85% реже. Поиск уязвимостей в исходном коде разрешён, а сканирование бинарников, тестирование на проникновение и генерация эксплойтов блокируются. В Claude.ai, Claude Code и Claude Cowork помеченный запрос по умолчанию уходит на Opus 4.8; участники программы Cyber Verification Program сразу получили версию с меньшими ограничениями.

Биологию перенастроили похоже. Запросы, которые блокирует Fable 5, теперь уходят на Opus 5 вместо Opus 4.8, и модель стала самой сильной общедоступной для научных задач. Ограничение Anthropic называет прямо - на длинных автономных исследованиях модель всё ещё слаба, а именно там риски в биологии максимальны.

Две беты в API

Вместе с моделью вышли два обновления в статусе беты. 

  1. Смена набора инструментов посреди диалога без сброса кеша промпта; раньше подмена инструментов у агента обнуляла кеш и била по стоимости. 
  2. Автоматические фоллбэки: запрос, помеченный фильтрами безопасности на Opus 5 или Fable 5, можно направить на другую модель вместо отказа. 

Требований к хранению данных для общего доступа, как и у прошлых Opus, нет.

Сноска под графиком Frontier-Bench

Главный тест релиза Anthropic прогоняла сама, и в сноске указано, что при отказах фильтров безопасности роль подстраховки для Opus 5 и Fable 5 играла Opus 4.8. Цифра рекорда получена в конфигурации, где рядом работала вторая модель, а независимые прогоны на публичных лидербордах покажут, насколько разрыв сохранится.

Opus 5 - четвёртая модель Anthropic меньше чем за два месяца: Fable 5 в начале июня, Sonnet 5 в конце июня, теперь Opus 5. Компания перестала выпускать по флагману в квартал и начала закрывать ценовые слоты по очереди. О размере контекстного окна и дате отсечки знаний в анонсе не сказано ни слова, хотя для тех, кто строит на модели агентов, эти два числа обычно значат больше, чем места в таблицах.

08:00
234
Нет комментариев. Ваш будет первым!