Microsoft выпустила кибермодель MAI-Cyber-1-Flash и агентную систему защиты Perception

Microsoft представила MAI-Cyber-1-Flash - первую собственную модель для кибербезопасности. Она встроена в MDASH, агентную систему поиска и устранения уязвимостей в коде. Вместе с ней компания запустила Perception, набор агентных команд для служб безопасности.
Microsoft выпустила кибермодель MAI-Cyber-1-Flash и агентную систему защиты Perception

MAI-Cyber-1-Flash - компактная модель, обученная под один класс задач: находить уязвимости в больших кодовых базах, оценивать их опасность и предлагать патчи. Анонс подписали Мустафа Сулейман и Хайете Гэллот, глава направления безопасности; презентацию провели на закрытом мероприятии в Сан-Франциско. Модель не продаётся отдельно - она работает только внутри MDASH, многоагентного контура сканирования кода.

Компактная модель из линейки MAI-Code

Технически MAI-Cyber-1-Flash - дообученная версия MAI-Code-1-Flash с архитектурой Mixture-of-Experts: 137 млрд параметров всего, 5 млрд активных на запрос. Контекстное окно - 256 тысяч токенов, чего хватает, чтобы держать в поле зрения крупный модуль целиком, а не отдельные файлы.

Расчёт Microsoft (Майкрософт) простой и вполне убедительный. При постоянном сканировании кода узкое место - стоимость токенов, а не качество самой сильной модели в парке. Маленькая модель закрывает до 90% рутины, тяжёлая подключается к оставшимся 10% действительно сложных случаев. По подсчётам компании, такая раскладка обходится вдвое дешевле прежней конфигурации MDASH, собранной из GPT-5.4, 5.4 mini и 5.3 codex.

96% на CyberGym даёт связка

Главная цифра релиза - 95,95% на CyberGym, публичном наборе из более чем 1500 задач по анализу уязвимостей в 188 реальных проектах. Прирост Microsoft описывает честно: замена 80% моделей внутри MDASH на MAI-Cyber-1 подняла результат системы с 88,4% до 95,95%. У ближайших конкурентов на том же тесте 83,2–85,6%.

Здесь нужно оговориться. 96% - это показатель связки MAI-Cyber-1-Flash с GPT-5.4 внутри обвязки со ста с лишним агентами, а не модели самой по себе.

Отдельно от MDASH результаты скромнее

В карточке MAI-Cyber-1-Flash есть и сольные замеры MAI-Cyber-1-Flash в лёгкой терминальной обвязке, и они куда сдержаннее: 0,314 на CVEBench, 0,651 на CRSBench, нули по всем трём категориям ExploitGym. Частично это следствие осознанной настройки - Microsoft описывает «security-first калибровку», при которой модель отказывается от неоднозначных запросов чаще, чем нужно легитимному защитнику, и намеренно разучена генерировать эксплойты и вредоносный код.

Читать эти цифры как слабость модели неправильно, но и переносить рекламные 96% на саму MAI-Cyber-1-Flash нельзя. Продукт здесь - система, а не веса.

Красные, синие и зелёные агенты

Второй анонс дня - Perception, платформа агентных команд для повседневных задач службы безопасности. Красные агенты моделируют атаки и профили злоумышленников, синие ищут и сортируют существующие баги, зелёные вносят исправления. Perception умеет работать в связке с MDASH, а позже получит MAI-Cyber-1-Flash и для сценариев за пределами поиска уязвимостей в коде.

Дэйв Уэстон, ведущий инженер Perception, описывает выигрыш во времени: то, на что раньше уходили часы работы нескольких специалистов, система проходит за минуты - от обнаружения и приоритизации до готового патча и правки конфигурации.

Доступ только по отдельному одобрению

Разлёт между сценой и документами заметный. Сулейман на презентации сказал, что связку «отгружают в продакшен немедленно», хотя новые инструменты безопасности выйдут в превью 3 ноября. Сама MAI-Cyber-1-Flash раздаётся через Azure AI Foundry в закрытом предварительном доступе, работает исключительно внутри MDASH и достаётся не всем желающим: из-за двойного назначения кибермоделей Microsoft проверяет и утверждает каждого клиента вручную.

Безопасность модели проверяли в несколько слоёв - автоматическим красным тестированием на базе PyRIT с миллионом с лишним многоходовых джейлбрейк-диалогов, ручными сценариями экспертов и независимой сторонней оценкой, которая не нашла находок критической серьёзности.

Anthropic и OpenAI пришли раньше

Ниша к июлю уже занята. Anthropic в апреле показала Mythos и раздавала доступ узкому кругу партнёров через программу Glasswing, OpenAI в мае запустила Daybreak. Microsoft заходит последней, зато с активом, который конкурентам не воспроизвести: телеметрией со 100 трлн сигналов безопасности в сутки, историей реальных эксплойтов и патчей и 1,6 млн корпоративных клиентов, на которых всё это обкатывается.

Проверочная точка - ноябрьское превью

Отраслевой сдвиг за релизом читается ясно: специализированная модель на 5 млрд активных параметров плюс дешёвая маршрутизация задач бьёт универсального гиганта на прикладном классе задач, и делает это вдвое дешевле. Схему будут копировать - сначала в безопасности, потом в других узких доменах.

Вопрос к MAI-Cyber-1-Flash другой. Всё, что показала Microsoft, измерено на бенчмарке; в бою метрика другая - сколько ложных срабатываний разгребут инженеры и сколько патчей от зелёных агентов придётся откатывать. Первые честные ответы появятся после 3 ноября, когда за систему возьмутся клиенты, а не её авторы.

07:25
165
Нет комментариев. Ваш будет первым!