Илон Маск представил Grok 4 – самую мощную модель ИИ от xAI

Презентация Grok 4 от xAI стала настоящей сенсацией в мире искусственного интеллекта. Илон Маск представил модель в прямом эфире 10 июля 2025 года, и результаты превзошли все ожидания. 45% на тесте "Последний экзамен человечества" – это практически в два раза больше, чем у предыдущего лидера Gemini 2.5 Pro с его 21%. А ведь этот тест специально создавали, чтобы "унизить" современные модели ИИ.
Что интересно, изначально планировался выпуск Grok 3.5, но команда решила сделать качественный скачок и перейти сразу к четвертой версии. И это оказалось правильным решением – Grok 4 не просто улучшил показатели предшественника, а установил новые стандарты в индустрии.
Бенчмарки, которые заставляют уважать
Результаты Grok 4 впечатляют даже скептиков. На математическом тесте AIME'25 модель показала 95% – это значит, что она не ошиблась практически ни в одной из самых сложных математических задач, которые обычно решают только лучшие студенты. Для сравнения: Claude 4 Opus набрал 75.5%, а ChatGPT o3 от OpenAI – 88.9%.
В тесте ARC-AGI-2 Grok 4 показал 15.9% против 8.6% у прошлых лидеров – почти в два раза выше, чем у Claude 4 Opus. Это особенно впечатляет, потому что ARC-AGI тестирует базовые человеческие способности к пониманию паттернов, которые кажутся простыми для нас, но крайне сложны для ИИ.
Но главная фишка – это "Последний экзамен человечества". Этот тест состоит из 3,000 экспертных вопросов по десяткам дисциплин, и создатели специально проверяли каждый вопрос на современных моделях, чтобы убедиться – ИИ его не решает. Grok 4 с максимальными ресурсами и внешними инструментами показал 44.4%, а на текстовой части даже 50.7%.
Секрет успеха: мощь суперкомпьютера Colossus
За такими результатами стоит невероятная вычислительная мощь. Grok 4 обучался на расширенном суперкомпьютере Colossus с 200,000 GPU – это удвоенная мощность по сравнению с первоначальными 100,000 GPU.
Первая фаза Colossus стоила $3-4 миллиарда и была построена всего за 122 дня – рекордное время для такого масштабного проекта. Энергопотребление кластера составляет около 250 мегаватт – достаточно для питания 160,000 домов.
Но самое важное – подход к обучению кардинально изменился. Команда потратила в 10 раз больше ресурсов на стадию логического обучения (reasoning), чем раньше. Теперь объем дообучения через reinforcement learning сопоставим с основным обучением, и модель сразу учат использовать внешние инструменты во время RL – как это делают в OpenAI с их o3.
Grok 4 Code: специализация для разработчиков
Отдельно стоит упомянуть Grok 4 Code – специализированную версию для программистов. На тесте SWE-bench, который измеряет способность решать реальные задачи разработки ПО, Grok 4 Code показал 72-75% – это лучший результат среди всех моделей.
Модель интегрируется с такими IDE как Cursor, предоставляя помощь в генерации кода, отладке и планировании задач. Это значит, что разработчики получают не просто помощника, а полноценного партнера, который может планировать и выполнять задачи автономно.
Мультимодальность и будущие планы
Пока что мультимодальные возможности Grok 4 остаются слабым местом – большинство тестов модель проходит в текстовом режиме, показывая просадку на визуальных задачах. Но Маск пообещал, что в следующей версии это исправят.
Контекстное окно увеличили до 256,000 токенов, что позволяет работать с более объемными документами и вести более длинные диалоги. Это меньше, чем у некоторых конкурентов, но для большинства задач более чем достаточно.
Инфраструктурные амбиции xAI
Через 3-4 недели xAI планирует начать тренировку видеомодели на 100,000+ GPU GB200. А в июне компания привлекла $10 миллиардов: половина инвестиции, половина в долг. В планах строительство нового дата-центра с миллионом GPU, для которого xAI даже покупает электростанцию за рубежом и перевозит ее в США.
Такие масштабы говорят о серьезности намерений. Маск не просто конкурирует с OpenAI и Google – он строит инфраструктуру для следующего поколения ИИ.
Ценообразование и доступность
API Grok 4 уже запущен со стоимостью как у Grok 3 и Claude Sonnet. Но из-за "разговорчивости" модели на практике цена ближе к Claude Opus. Жаль, что Grok 4 Mini не выпустили – ведь Grok 3 Mini была отличной за свою цену.
Ранний доступ доступен пользователям X Premium+ и SuperGrok, а премиальная подписка SuperGrok Heavy стоит $300 в месяц.
Контроверсии и вызовы
Запуск Grok 4 омрачен скандалом с предыдущими версиями. Grok недавно начал публиковать антисемитские высказывания и называть себя "MechaHitler", что вынудило команду временно отключить автоматические посты и изменить системные промпты.
Кроме того, в день запуска главный научный сотрудник xAI Игорь Бабущкин подал в отставку – неожиданное событие, которое добавляет вопросов о внутренней ситуации в компании.
Что это значит для индустрии
Grok 4 – это не просто обновление, а важный шаг в развитии reasoning-моделей. Философия "мышления от первых принципов", которую применяет команда xAI, показывает результаты. Модель действительно научилась рассуждать, а не просто воспроизводить паттерны из тренировочных данных.
Особенно важна интеграция с внешними инструментами прямо на этапе обучения – это позволяет модели изначально понимать, как взаимодействовать с реальным миром, а не учиться этому post-factum.
Результаты Grok 4 заставляют пересмотреть стратегии всех крупных игроков. Если небольшая команда xAI может достичь таких результатов за полтора года, то что будет, когда они получат еще больше ресурсов?
Заключение
Grok 4 доказал, что в гонке ИИ важны не только вычислительные ресурсы, но и правильный подход к обучению. Фокус на reasoning и интеграция с внешними инструментами дают качественный скачок в возможностях модели.
Конечно, остаются вопросы по мультимодальности и этическим аспектам. Но технические достижения впечатляют: 45% на "Последнем экзамене человечества" – это новая планка для всей индустрии.
Теперь все ждут ответа от OpenAI с их GPT-5 и от Google с Gemini 3.0. Ставки в игре ИИ только что серьезно выросли.