Илон Маск представил Grok 4 – самую мощную модель ИИ от xAI

Модель обучалась на суперкомпьютере Colossus с 200,000 GPU и в 10 раз больше ресурсов потратила на изучение логических рассуждений. Презентация прошла в прямом эфире утром 10 июля 2025 года и показала качественный скачок в развитии ИИ, который может изменить всю индустрию.
Илон Маск представил Grok 4 – самую мощную модель ИИ от xAI

Презентация Grok 4 от xAI стала настоящей сенсацией в мире искусственного интеллекта. Илон Маск представил модель в прямом эфире 10 июля 2025 года, и результаты превзошли все ожидания. 45% на тесте "Последний экзамен человечества" – это практически в два раза больше, чем у предыдущего лидера Gemini 2.5 Pro с его 21%. А ведь этот тест специально создавали, чтобы "унизить" современные модели ИИ.

Что интересно, изначально планировался выпуск Grok 3.5, но команда решила сделать качественный скачок и перейти сразу к четвертой версии. И это оказалось правильным решением – Grok 4 не просто улучшил показатели предшественника, а установил новые стандарты в индустрии.

Бенчмарки, которые заставляют уважать

Результаты Grok 4 впечатляют даже скептиков. На математическом тесте AIME'25 модель показала 95% – это значит, что она не ошиблась практически ни в одной из самых сложных математических задач, которые обычно решают только лучшие студенты. Для сравнения: Claude 4 Opus набрал 75.5%, а ChatGPT o3 от OpenAI – 88.9%.

В тесте ARC-AGI-2 Grok 4 показал 15.9% против 8.6% у прошлых лидеров – почти в два раза выше, чем у Claude 4 Opus. Это особенно впечатляет, потому что ARC-AGI тестирует базовые человеческие способности к пониманию паттернов, которые кажутся простыми для нас, но крайне сложны для ИИ.

Но главная фишка – это "Последний экзамен человечества". Этот тест состоит из 3,000 экспертных вопросов по десяткам дисциплин, и создатели специально проверяли каждый вопрос на современных моделях, чтобы убедиться – ИИ его не решает. Grok 4 с максимальными ресурсами и внешними инструментами показал 44.4%, а на текстовой части даже 50.7%.

Секрет успеха: мощь суперкомпьютера Colossus

За такими результатами стоит невероятная вычислительная мощь. Grok 4 обучался на расширенном суперкомпьютере Colossus с 200,000 GPU – это удвоенная мощность по сравнению с первоначальными 100,000 GPU.

Первая фаза Colossus стоила $3-4 миллиарда и была построена всего за 122 дня – рекордное время для такого масштабного проекта. Энергопотребление кластера составляет около 250 мегаватт – достаточно для питания 160,000 домов.

Но самое важное – подход к обучению кардинально изменился. Команда потратила в 10 раз больше ресурсов на стадию логического обучения (reasoning), чем раньше. Теперь объем дообучения через reinforcement learning сопоставим с основным обучением, и модель сразу учат использовать внешние инструменты во время RL – как это делают в OpenAI с их o3.

Grok 4 Code: специализация для разработчиков

Отдельно стоит упомянуть Grok 4 Code – специализированную версию для программистов. На тесте SWE-bench, который измеряет способность решать реальные задачи разработки ПО, Grok 4 Code показал 72-75% – это лучший результат среди всех моделей.

Модель интегрируется с такими IDE как Cursor, предоставляя помощь в генерации кода, отладке и планировании задач. Это значит, что разработчики получают не просто помощника, а полноценного партнера, который может планировать и выполнять задачи автономно.

Мультимодальность и будущие планы

Пока что мультимодальные возможности Grok 4 остаются слабым местом – большинство тестов модель проходит в текстовом режиме, показывая просадку на визуальных задачах. Но Маск пообещал, что в следующей версии это исправят.

Контекстное окно увеличили до 256,000 токенов, что позволяет работать с более объемными документами и вести более длинные диалоги. Это меньше, чем у некоторых конкурентов, но для большинства задач более чем достаточно.

Инфраструктурные амбиции xAI

Через 3-4 недели xAI планирует начать тренировку видеомодели на 100,000+ GPU GB200. А в июне компания привлекла $10 миллиардов: половина инвестиции, половина в долг. В планах строительство нового дата-центра с миллионом GPU, для которого xAI даже покупает электростанцию за рубежом и перевозит ее в США.

Такие масштабы говорят о серьезности намерений. Маск не просто конкурирует с OpenAI и Google – он строит инфраструктуру для следующего поколения ИИ.

Ценообразование и доступность

API Grok 4 уже запущен со стоимостью как у Grok 3 и Claude Sonnet. Но из-за "разговорчивости" модели на практике цена ближе к Claude Opus. Жаль, что Grok 4 Mini не выпустили – ведь Grok 3 Mini была отличной за свою цену.

Ранний доступ доступен пользователям X Premium+ и SuperGrok, а премиальная подписка SuperGrok Heavy стоит $300 в месяц.

Контроверсии и вызовы

Запуск Grok 4 омрачен скандалом с предыдущими версиями. Grok недавно начал публиковать антисемитские высказывания и называть себя "MechaHitler", что вынудило команду временно отключить автоматические посты и изменить системные промпты.

Кроме того, в день запуска главный научный сотрудник xAI Игорь Бабущкин подал в отставку – неожиданное событие, которое добавляет вопросов о внутренней ситуации в компании.

Что это значит для индустрии

Grok 4 – это не просто обновление, а важный шаг в развитии reasoning-моделей. Философия "мышления от первых принципов", которую применяет команда xAI, показывает результаты. Модель действительно научилась рассуждать, а не просто воспроизводить паттерны из тренировочных данных.

Особенно важна интеграция с внешними инструментами прямо на этапе обучения – это позволяет модели изначально понимать, как взаимодействовать с реальным миром, а не учиться этому post-factum.

Результаты Grok 4 заставляют пересмотреть стратегии всех крупных игроков. Если небольшая команда xAI может достичь таких результатов за полтора года, то что будет, когда они получат еще больше ресурсов?

Заключение

Grok 4 доказал, что в гонке ИИ важны не только вычислительные ресурсы, но и правильный подход к обучению. Фокус на reasoning и интеграция с внешними инструментами дают качественный скачок в возможностях модели.

Конечно, остаются вопросы по мультимодальности и этическим аспектам. Но технические достижения впечатляют: 45% на "Последнем экзамене человечества" – это новая планка для всей индустрии.

Теперь все ждут ответа от OpenAI с их GPT-5 и от Google с Gemini 3.0. Ставки в игре ИИ только что серьезно выросли.

09:40
629
Нет комментариев. Ваш будет первым!