Cursor и SpaceXAI выпустили Grok 4.5 - первую модель Cursor не только для кода

8 июля Cursor выпустила Grok 4.5 - новую флагманскую модель, обученную совместно со SpaceXAI (бывшая xAI). Это первая модель компании, которая рассчитана на что-то шире кода: разработчики называют её пригодной для data science, финансов, юридической работы и вообще любых задач за компьютером. Модель уже доступна во всех продуктах Cursor, а прежняя линейка Composer 2.5 остаётся отдельным, более компактным вариантом.
Cursor выходит за пределы кода
Composer 2.5 готовили как узкого специалиста по коду. Для Grok 4.5 состав тренировочных данных расширили сознательно: добавили сложные STEM-задачи, научные статьи и другую работу со знаниями, чтобы модель освоилась в разных областях.
Основа - триллионы токенов собственных данных Cursor, реальных взаимодействий пользователей с кодовыми базами и инструментами. Такой набор учит модель на существующем коде и на том, как разработчики и агенты действуют вместе в реальной работе. Архитектура - mixture-of-experts, где на каждый запрос активируется только часть параметров модели, удешевляя и ускоряя вычисления.
Обучающие среды строили сами агенты
Модель дообучали через reinforcement learning на трудных задачах в реалистичных средах - и для разработки, и для остальной работы со знаниями. Такие среды учат модель разбираться в проблеме, пользоваться инструментами, исправлять свои ошибки и проверять результат.
Часть задач специально делали настолько сложными, чтобы с ними не справлялись даже топовые модели. По мере роста возможностей старые задачи быстро превращаются в рутину и перестают чему-то учить. Чтобы строить такие среды в промышленных масштабах, Cursor собрала распределённую систему из агентов: инженер описывает задачу и способ проверки решения, а дальше группы агентов сами собирают, тестируют и дорабатывают среду. Некоторые из них потребовали бы месяцев работы сотен инженеров-людей. Предыдущая модель Cursor в буквальном смысле помогала строить следующую.
Кибербезопасность: не понижают тихо
Те же улучшения в коде и работе с инструментами, которые делают Grok 4.5 полезной моделью, повышают и её пригодность для взлома. Cursor обновила систему обнаружения и блокировки злоумышленников, компания подчёркивает, что не понижает незаметно интеллект модели и не подменяет её более слабой версией для подозрительных пользователей. Вместо этого ограничивают конкретные сценарии использования, а легитимную работу по безопасности, поиск и закрытие уязвимостей, стараются не задевать.
Такая прозрачность про точечные ограничения - редкость. Большинство вендоров подобные случаи вообще не комментируют.
Два веса вместо одного
Grok 4.5 доступна с 8 июля во всех продуктах Cursor: на десктопе, в вебе, в iOS-приложении, в CLI и через SDK. Индивидуальные и командные тарифы включают заметный объём использования модели, а на первую неделю лимит удвоили. Базовая версия стоит $2 за миллион входных токенов и $6 за миллион выходных, быстрый вариант - $4 и $18 соответственно.
Composer 2.5 остаётся в продаже, и Cursor обещает выпускать модели такого же компактного веса и дальше. Получается два параллельных семейства: быстрый и дешёвый Composer для повседневного кода и тяжёлый Grok для сложных многодоменных задач.
Тот же бенчмарк, который разгромила OpenAI
В собственной таблице сравнения Cursor приводит результаты по SWE-Bench Pro - том самом бенчмарке, который в тот же день, 8 июля, OpenAI назвала сломанным в 27-34% задач. Сама Cursor в сносках уточняет: часть цифр конкурентов - это самоотчёты вендоров, без независимой проверки. Отдельно компания честно признаёт, что преимущество Grok 4.5 на собственном CursorBench объясняется случайностью: в обучающие данные попал старый снимок кодовой базы Cursor. Насколько это исказило результат, там не знают, данные из будущих моделей убрали, а сам CursorBench сейчас переделывают - и из-за этого исключили его из сравнения в этом посте.

Открытый вопрос - как Grok 4.5 поведёт себя за пределами кода. Все примеры в посте Cursor всё ещё крутятся вокруг разработки, а конкретных кейсов из data science, финансов или юриспруденции нет ни одного. Ответ появится, когда модель начнут гонять на реальных задачах пользователи, а не бенчмарки, доверие к которым в этом же месяце подорвали и OpenAI, и сама Cursor.