OpenAI выпустила GPT-6 Astra и объявила наступление эры AGI
GPT-6 Astra — новый флагман OpenAI , и компания подаёт релиз как смену эпохи. Модель рассчитана на самостоятельную работу за компьютером, от заполнения форм до сборки чертежа, и доводит задачу до конца без подсказок на каждом шаге. Выкатывают её осторожно, начиная с корпоративных клиентов закрытой программы.
Astra берёт мышку сама
До сих пор, чтобы подключить модель к рабочей программе, разработчикам приходилось строить отдельную интеграцию через API и прослойки-коннекторы. Astra обращается с компьютером так же, как человек. Она открывает браузер, заполняет таблицы, правит документы, обновляет карточки в CRM, собирает дашборды и трёхмерные модели. Указывать, куда нажать и что ввести, больше не нужно.
На демонстрациях модель работала в KiCad и FreeCAD, собирала небольшие игры в Unity, форматировала договоры и верстала сайты. OpenAI показывает сценарий целиком, от постановки задачи до готового файла, и этим подача Astra отличается от прошлых релизов.
«Думаю, вполне разумно ощущать, что мы теперь в эре AGI»,
- сказал журналистам президент OpenAI Грег Брокман.
98,6% против 7,8% у Sol
Главную цифру релиза OpenAI взяла из ARC-AGI-3. Этот тест проверяет способность разобраться в незнакомых правилах с нуля, эрудиция здесь не выручает, поэтому его давно используют как приблизительный замер «общего» интеллекта. Astra решает 98,6% заданий. Прошлый флагман GPT-5.6 Sol не добирается и до 8%, Claude Opus 5 в усиленном режиме показывает 30,2%.
Оговорка здесь нужна. В августе конструкция NVIDIA AVO взяла на том же тесте 100%, но это была надстройка с внешней памятью и инструментами поверх Claude Opus 5, а не одна модель. Astra проходит тест сама, и это честный результат, который пока остаётся результатом внутри бенчмарка.
Где Astra оторвалась заметно
Остальную таблицу OpenAI собрала из тестов, названия которых мало кому что говорят. Что за ними стоит:
-
FrontierMath Tier 4— исследовательские математические задачи верхней сложности. У Astra 97,6% против 83% у GPT-5.6 Sol и 87,8% у Claude Fable 5.1; -
Terminal-Bench Science— научные расчёты, которые модель ведёт в командной строке. 64,6% против 22,4% у Sol; -
BenchCAD— построение чертежа по изображению. 95,9% против 83,3%; -
SRE-Bench— разбор аварий в рабочей инфраструктуре, четыре попытки на задачу. 99,2% против 68,7%; -
GPQA Diamond— вопросы уровня аспирантуры по естественным наукам. 96%, у Gemini 3.8 Flash 95,3%.
Прирост Astra распределён неровно. Там, где модель работает руками — считает, чертит, лезет в терминал, — разрыв с прошлым поколением кратный. Там, где нужна широкая эрудиция, счёт идёт на единицы процентов.
Слабые строки той же таблицы
OpenAI вынесла на слайд и те тесты, где Astra выглядит скромно. На Agents' Last Exam модель набирает 59,3% при 52,7% у Claude Opus 5. На AutomationBench, который меряет офисную автоматизацию, — 41,4%. На биологическом GeneBench Pro — 39%. В медицинском HealthBench Professional 63,4% против 60,9% у Claude Fable 5, разрыв в три пункта.
Компания, которая объявляет наступление AGI, показывает рядом тест на рутинную офисную работу с результатом ниже половины. Это к вопросу о том, что именно случилось 3 сентября.
Кодинг закончился почти ничьёй
На DeepSWE v1.1, где модели чинят реальные баги в репозиториях, Astra набирает 74,1%. Gemini 3.8 Flash — 73,7%, GPT-5.6 Sol — 70,8%, Claude Opus 5 — 68,8%. Meta Muse Spark 1.3 на максимальном режиме рассуждений выдаёт 75,4% и обходит Astra.
Разница между первыми местами укладывается в обычный разброс таких замеров. Программирование перестало быть полем, где новый флагман отрывается от рынка, и сильные стороны Astra лежат в стороне от кода.
Сорок минут на одну задачу
Агентные способности Astra меряют на OSWorld 2.0 — наборе обычных задач за компьютером, от работы с файлами до заполнения веб-форм. Модель верно решает 72,6%, тратя около 40 минут на задачу. GPT-5.6 Sol справлялся с 65,7% за 75 минут.
Скорость выросла почти вдвое, точность прибавила семь пунктов. Больше четверти привычных для человека рабочих задач «первая модель эры AGI» всё ещё проваливает, и об этом стоит помнить, когда речь заходит о сотрудниках, которым больше не нужна мышка.
Десять долларов на входе
Astra стоит 10 долларов за миллион входных токенов и 50 долларов за миллион выходных. Ускоренный режим с примерно двух-с-половиной-кратной скоростью обработки обойдётся вдвое дороже. Для сравнения по рынку: GPT-5.6 Sol идёт по 5 и 30 долларов, Claude Opus 5 — по 5 и 25, Claude Fable 5.1 — ровно как Astra, а Gemini 3.8 Flash стоит 0,75 и 3,75 доллара.
Брокман предлагает считать иначе.
«Считать токены больше не имеет смысла»,
- заявил Грег Брокман, объясняя, что теперь важна цена за выполненную задачу, а не за миллион символов.
Формулировка удобная. Если задача решается за один прогон, дорогая модель действительно выходит дешевле цепочки из десяти дешёвых запросов. Проверить это OpenAI предлагает на своих счетах, а не на своих цифрах.
Первый критический киберуровень
Astra стала первой моделью OpenAI, которая дошла до критического уровня киберспособностей по внутренней рамке готовности компании. На испытаниях она нашла две ранее неизвестные уязвимости и собрала рабочие цепочки их эксплуатации. Публично об этом OpenAI сообщила 1 сентября, за два дня до релиза.
Меры вокруг модели ужесточили. Обучение и тесты перевели в изолированные среды, включили сплошной мониторинг рискованных действий, а на вредные киберзапросы Astra отказывает в 91,5% случаев против 59% у Sol. Наступательные функции остаются доступны узкому кругу проверенных специалистов по защите через программу Daybreak Blue.
«Когда модели делают больше вещей самостоятельно, мы должны иметь возможность доверять им сильнее»,
- отметила вице-президент OpenAI по исследованиям Амелия Глейзе.
Одна деталь из отчётов идёт вразрез с общей картиной. По части тестов на уклонение письменные рассуждения Astra оказались труднее для наблюдения, чем у Sol. Модель, за которой поставили самый плотный надзор в истории компании, одновременно стала чуть менее прозрачной.
Двери в Astra
Первыми Astra получают корпоративные клиенты закрытой программы Daybreak. Дальше, «в ближайшие дни», модель открывают подписчикам ChatGPT уровней Plus, Pro, Business и Enterprise, разработчикам через API OpenAI, а также в облаках Amazon Bedrock и Microsoft Azure.
Расход Astra укладывается в лимиты действующей подписки, дополнительные кредиты можно докупить отдельно. Заодно OpenAI обновила Codex — среда научилась держать заметки между сессиями, чтобы прошлый контекст оставался доступным для поиска. Функция пока экспериментальная.
Российскому читателю придётся учитывать привычное ограничение. OpenAI официально в стране не работает, подписки ChatGPT и доступ к API оформляются в обход, а программа Daybreak с проверкой личности и организации закрыта полностью.
Задача словами вместо интеграции
Практическая часть релиза Astra касается тех, кто автоматизировал рутину через интеграции. Если задача сводилась к связке из нескольких сервисов, которую собирали руками, её теперь дешевле поставить словами и отдать модели вместе с браузером. Считать теперь удобнее стоимость одного законченного прогона, а не расход токенов.
Второе следствие — паузы. Мониторинг вокруг Astra реагирует на запросы про уязвимости, подозрительный код и сетевые инструменты, и законная работа тоже попадает под проверку. В ChatGPT и Codex у пользователя запросят подтверждение, а через API задача может просто оборваться.
Эра объявлена, четверть задач мимо
Astra уверенно берёт то, что можно измерить бенчмарком, и спотыкается на том, что измеряется рабочим днём. Между 98,6% на тесте абстрактного мышления и 72,6% на обычных компьютерных задачах лежит вся дистанция от заявления Брокмана до реальности.
Проверочная точка появится через несколько недель, когда Astra дойдёт до подписчиков Plus и её начнут гонять на живых задачах вне контролируемых демонстраций. Пока «эра AGI» держится на одной строке таблицы, которую составила сама OpenAI.