CoreWeave открыла доступ к Vera Rubin

CoreWeave открыла общий доступ к системам NVIDIA Vera Rubin NVL72 с сетью Spectrum-X 102.4T Ethernet. Первым рабочие нагрузки на них запустил Cognition, разработчик ИИ-инженера Devin.
CoreWeave открыла доступ к Vera Rubin

Анонс прозвучал на конференции CoreWeave Fully Connected в Сан-Франциско. Компания подаёт запуск как продолжение почти десятилетней совместной работы с NVIDIA, а не как разовую поставку железа. Ставка на то, что клиент остаётся на одной платформе от обучения модели до её работы в проде.

Cognition первой получила Vera Rubin

Cognition обучает, дообучает и обслуживает Devin на мощностях CoreWeave. За девять месяцев компания выросла до тысяч GPU на этой платформе. Первые производственные стойки Vera Rubin NVL72 CoreWeave получила в этом месяце, и почти сразу Cognition прогнала на них тест.

Сравнивали с базой GB200 NVL72 на реальной задаче по разработке ПО. Задачи брали из набора FrontierCode, решать их отправляли ИИ-агентов. В ранних тестах Vera Rubin NVL72 дала до 4,8 раза больше суммарной пропускной способности по токенам на нагрузках SWE-2. Для Devin это ускорение генерации кода в реальном времени и более отзывчивое многошаговое рассуждение.

«Агентное программирование это сложная нагрузка, длинные контексты, высокая параллельность и объёмы токенов, где стоимость токена решает, что мы можем выпустить»,

- сказал Силас Альберти, участник команды основателей Cognition.

Он добавил, что для компании важнее держать всё на одной платформе с инженерами NVIDIA и CoreWeave, чем гнаться за отдельной характеристикой. Реплика показательная. На рынке, где почти все облака предлагают похожие ускорители, конкуренция уходит в поддержку и в то, насколько быстро партнёр помогает разбирать конкретную нагрузку клиента.

Vera CPU заточена под агентов

CoreWeave обещает предложить и NVIDIA Vera, первый CPU, построенный под ИИ-агентов. Агентные нагрузки давят на инфраструктуру с двух сторон. Обслуживание агентов требует вычислений с низкой задержкой в больших объёмах, а дообучение требует тысяч изолированных сред одновременно.

Ключевая метрика здесь, сколько изолированных сред держится разом и насколько ровно каждая из них работает при росте числа. В стойке Vera помещается 128 процессоров и 11 264 ядра, этого хватает более чем на 11 000 одновременных сред по одному ядру на каждую. Среды в CoreWeave Sandboxes изолированы на уровне железа и работают рядом с обучающими задачами, а коммутаторы Spectrum-X Ethernet и BlueField-4 DPU обеспечивают обмен между агентами с низкой задержкой.

В тестах CoreWeave получила более чем трёхкратное ускорение запуска агентных песочниц на Vera CPU. На Terminal-Bench прирост по всем пройденным задачам составил 1,7 раза. Песочницы нужны для обучения с подкреплением, вызова инструментов агентом и оценки моделей, то есть для слоя, где команды гоняют код в изоляции.

Forge собирает цикл в одном месте

Модели и агенты улучшаются по замкнутому кругу. Поведение в проде питает следующий прогон обучения, а каждая оценка уточняет следующую версию. Раньше этот цикл расползался по инструментам разных поставщиков, и на каждой передаче терялся сигнал. CoreWeave Forge сводит всё в одну среду и остаётся открытым для разных моделей, фреймворков и облаков.

Внутри объединены Weights & Biases, наработки по дообучению от OpenPipe и открытый проект блокнотов marimo. Среди первых компаний, которые строят на Forge, Canva, Capital One и MasterClass. Открытые модели NVIDIA Nemotron дают командам прямой путь к донастройке моделей рассуждения и мультимодальных моделей под агентные сценарии.

Что уже доступно и что обещано

  • CoreWeave ARIA. Перешла в общий доступ. Помогает учиться, исследовать и писать код по всему циклу, разбирает прогоны, предлагает эксперименты и правки в коде, хранит их в GitHub и возвращает выводы по данным.
  • CoreWeave Agent Lens. Новая служба. Превращает наблюдение за агентами в проде в постоянные улучшения, на 20 процентов лучше находит сбои и вдвое дешевле их чинит.
  • CoreWeave Sandboxes. Перешли в общий доступ. Дают изолированную среду на CPU или GPU для агентов, вызовов инструментов, обучения с подкреплением и оценок, без своего кластера.
  • RL Rollouts. В закрытом предварительном доступе. Подгружает новые контрольные точки в работающее развёртывание, поэтому обучение с подкреплением идёт без перезапуска.
  • NVIDIA Vera CPU. Обещана в облаке CoreWeave, сроков компания не называет.

Дообучение на своих производственных сигналах поднимает качество модели и снижает задержку с затратами. Серверные дообучение с учителем и обучение с подкреплением позволяют пробовать собственные рецепты, а серверный вариант RL по заявлению CoreWeave учится в 1,4 раза быстрее и на 40 процентов дешевле самостоятельного развёртывания. Управляемое обслуживание моделей и RL Rollouts работают на открытом фреймворке вывода NVIDIA Dynamo.

Кому это нужно на практике

Владельцам продуктов с ИИ-функциями смысл анонса в том, что цикл улучшения перестаёт требовать своей инфраструктуры. Песочницы и серверное дообучение позволяют проверять правки на реальных сигналах из прода, не поднимая отдельный кластер. Если ваш агент ошибается на длинных контекстах, смотреть стоит на связку Agent Lens и RL Rollouts, она как раз про разбор сбоев и дообучение без перезапуска.

В здравоохранении Ennoble Care, поставщик помощи на дому примерно для 50 000 пациентов по программе Medicare в 15 штатах, выбрал CoreWeave для вывода клинических моделей. Компания возьмёт зарезервированные мощности на GPU NVIDIA RTX PRO 6000 в CoreWeave Kubernetes Service, чтобы масштабировать агентов для клинической документации, поддержки решений и автоматизации бэк-офиса.

Заявленные 4,8 раза по токенам получены на ранних тестах и на выборке задач, а не на всём спектре нагрузок Devin. Проверять эти цифры придётся на своих сценариях, когда доступ к Vera Rubin получат остальные клиенты. Показательно другое. CoreWeave держит платиновый рейтинг в SemiAnalysis ClusterMAX версий 1.0, 2.0 и 3.0 и обслуживает девять из десяти ведущих ИИ-лабораторий, так что борьба за агентные нагрузки идёт не за железо, а за то, чей цикл обучения и вывода окажется короче.

Источник:
15:00
16
Нет комментариев. Ваш будет первым!