OpenAI выпустила GPT-6 Astra и объявила наступление эры AGI

OpenAI выпустила GPT-6 Astra - модель, которая садится за компьютер вместо человека и на тесте абстрактного мышления ARC-AGI-3 набрала 98,6% против 7,8% у прошлого флагмана. Презентацию 3 сентября президент компании Грег Брокман закрыл словами «добро пожаловать в эру AGI».
OpenAI выпустила GPT-6 Astra и объявила наступление эры AGI

GPT-6 Astra — новый флагман OpenAI , и компания подаёт релиз как смену эпохи. Модель рассчитана на самостоятельную работу за компьютером, от заполнения форм до сборки чертежа, и доводит задачу до конца без подсказок на каждом шаге. Выкатывают её осторожно, начиная с корпоративных клиентов закрытой программы.

Astra берёт мышку сама

До сих пор, чтобы подключить модель к рабочей программе, разработчикам приходилось строить отдельную интеграцию через API и прослойки-коннекторы. Astra обращается с компьютером так же, как человек. Она открывает браузер, заполняет таблицы, правит документы, обновляет карточки в CRM, собирает дашборды и трёхмерные модели. Указывать, куда нажать и что ввести, больше не нужно.

На демонстрациях модель работала в KiCad и FreeCAD, собирала небольшие игры в Unity, форматировала договоры и верстала сайты. OpenAI показывает сценарий целиком, от постановки задачи до готового файла, и этим подача Astra отличается от прошлых релизов.

«Думаю, вполне разумно ощущать, что мы теперь в эре AGI»,

- сказал журналистам президент OpenAI Грег Брокман.

98,6% против 7,8% у Sol

Главную цифру релиза OpenAI взяла из ARC-AGI-3. Этот тест проверяет способность разобраться в незнакомых правилах с нуля, эрудиция здесь не выручает, поэтому его давно используют как приблизительный замер «общего» интеллекта. Astra решает 98,6% заданий. Прошлый флагман GPT-5.6 Sol не добирается и до 8%, Claude Opus 5 в усиленном режиме показывает 30,2%.

Оговорка здесь нужна. В августе конструкция NVIDIA AVO взяла на том же тесте 100%, но это была надстройка с внешней памятью и инструментами поверх Claude Opus 5, а не одна модель. Astra проходит тест сама, и это честный результат, который пока остаётся результатом внутри бенчмарка.

Где Astra оторвалась заметно

Остальную таблицу OpenAI собрала из тестов, названия которых мало кому что говорят. Что за ними стоит:

  • FrontierMath Tier 4 — исследовательские математические задачи верхней сложности. У Astra 97,6% против 83% у GPT-5.6 Sol и 87,8% у Claude Fable 5.1;
  • Terminal-Bench Science — научные расчёты, которые модель ведёт в командной строке. 64,6% против 22,4% у Sol;
  • BenchCAD — построение чертежа по изображению. 95,9% против 83,3%;
  • SRE-Bench — разбор аварий в рабочей инфраструктуре, четыре попытки на задачу. 99,2% против 68,7%;
  • GPQA Diamond — вопросы уровня аспирантуры по естественным наукам. 96%, у Gemini 3.8 Flash 95,3%.

Прирост Astra распределён неровно. Там, где модель работает руками — считает, чертит, лезет в терминал, — разрыв с прошлым поколением кратный. Там, где нужна широкая эрудиция, счёт идёт на единицы процентов.

Слабые строки той же таблицы

OpenAI вынесла на слайд и те тесты, где Astra выглядит скромно. На Agents' Last Exam модель набирает 59,3% при 52,7% у Claude Opus 5. На AutomationBench, который меряет офисную автоматизацию, — 41,4%. На биологическом GeneBench Pro — 39%. В медицинском HealthBench Professional 63,4% против 60,9% у Claude Fable 5, разрыв в три пункта.

Компания, которая объявляет наступление AGI, показывает рядом тест на рутинную офисную работу с результатом ниже половины. Это к вопросу о том, что именно случилось 3 сентября.

Кодинг закончился почти ничьёй

На DeepSWE v1.1, где модели чинят реальные баги в репозиториях, Astra набирает 74,1%. Gemini 3.8 Flash — 73,7%, GPT-5.6 Sol — 70,8%, Claude Opus 5 — 68,8%. Meta Muse Spark 1.3 на максимальном режиме рассуждений выдаёт 75,4% и обходит Astra.

Разница между первыми местами укладывается в обычный разброс таких замеров. Программирование перестало быть полем, где новый флагман отрывается от рынка, и сильные стороны Astra лежат в стороне от кода.

Сорок минут на одну задачу

Агентные способности Astra меряют на OSWorld 2.0 — наборе обычных задач за компьютером, от работы с файлами до заполнения веб-форм. Модель верно решает 72,6%, тратя около 40 минут на задачу. GPT-5.6 Sol справлялся с 65,7% за 75 минут.

Скорость выросла почти вдвое, точность прибавила семь пунктов. Больше четверти привычных для человека рабочих задач «первая модель эры AGI» всё ещё проваливает, и об этом стоит помнить, когда речь заходит о сотрудниках, которым больше не нужна мышка.

Десять долларов на входе

Astra стоит 10 долларов за миллион входных токенов и 50 долларов за миллион выходных. Ускоренный режим с примерно двух-с-половиной-кратной скоростью обработки обойдётся вдвое дороже. Для сравнения по рынку: GPT-5.6 Sol идёт по 5 и 30 долларов, Claude Opus 5 — по 5 и 25, Claude Fable 5.1 — ровно как Astra, а Gemini 3.8 Flash стоит 0,75 и 3,75 доллара.

Брокман предлагает считать иначе.

«Считать токены больше не имеет смысла»,

- заявил Грег Брокман, объясняя, что теперь важна цена за выполненную задачу, а не за миллион символов.

Формулировка удобная. Если задача решается за один прогон, дорогая модель действительно выходит дешевле цепочки из десяти дешёвых запросов. Проверить это OpenAI предлагает на своих счетах, а не на своих цифрах.

Первый критический киберуровень

Astra стала первой моделью OpenAI, которая дошла до критического уровня киберспособностей по внутренней рамке готовности компании. На испытаниях она нашла две ранее неизвестные уязвимости и собрала рабочие цепочки их эксплуатации. Публично об этом OpenAI сообщила 1 сентября, за два дня до релиза.

Меры вокруг модели ужесточили. Обучение и тесты перевели в изолированные среды, включили сплошной мониторинг рискованных действий, а на вредные киберзапросы Astra отказывает в 91,5% случаев против 59% у Sol. Наступательные функции остаются доступны узкому кругу проверенных специалистов по защите через программу Daybreak Blue.

«Когда модели делают больше вещей самостоятельно, мы должны иметь возможность доверять им сильнее»,

- отметила вице-президент OpenAI по исследованиям Амелия Глейзе.

Одна деталь из отчётов идёт вразрез с общей картиной. По части тестов на уклонение письменные рассуждения Astra оказались труднее для наблюдения, чем у Sol. Модель, за которой поставили самый плотный надзор в истории компании, одновременно стала чуть менее прозрачной.

Двери в Astra

Первыми Astra получают корпоративные клиенты закрытой программы Daybreak. Дальше, «в ближайшие дни», модель открывают подписчикам ChatGPT уровней Plus, Pro, Business и Enterprise, разработчикам через API OpenAI, а также в облаках Amazon Bedrock и Microsoft Azure.

Расход Astra укладывается в лимиты действующей подписки, дополнительные кредиты можно докупить отдельно. Заодно OpenAI обновила Codex — среда научилась держать заметки между сессиями, чтобы прошлый контекст оставался доступным для поиска. Функция пока экспериментальная.

Российскому читателю придётся учитывать привычное ограничение. OpenAI официально в стране не работает, подписки ChatGPT и доступ к API оформляются в обход, а программа Daybreak с проверкой личности и организации закрыта полностью.

Задача словами вместо интеграции

Практическая часть релиза Astra касается тех, кто автоматизировал рутину через интеграции. Если задача сводилась к связке из нескольких сервисов, которую собирали руками, её теперь дешевле поставить словами и отдать модели вместе с браузером. Считать теперь удобнее стоимость одного законченного прогона, а не расход токенов.

Второе следствие — паузы. Мониторинг вокруг Astra реагирует на запросы про уязвимости, подозрительный код и сетевые инструменты, и законная работа тоже попадает под проверку. В ChatGPT и Codex у пользователя запросят подтверждение, а через API задача может просто оборваться.

Эра объявлена, четверть задач мимо

Astra уверенно берёт то, что можно измерить бенчмарком, и спотыкается на том, что измеряется рабочим днём. Между 98,6% на тесте абстрактного мышления и 72,6% на обычных компьютерных задачах лежит вся дистанция от заявления Брокмана до реальности.

Проверочная точка появится через несколько недель, когда Astra дойдёт до подписчиков Plus и её начнут гонять на живых задачах вне контролируемых демонстраций. Пока «эра AGI» держится на одной строке таблицы, которую составила сама OpenAI.

00:15
43
Нет комментариев. Ваш будет первым!