Alibaba выпускает Qwen3.8-Max на 2,4 трлн параметров и обещает открыть веса флагмана

Линейка Max верхняя полка Alibaba, куда компания складывает самые тяжёлые модели. До сих пор эти флагманы жили только за API. Qwen подаёт новый релиз иначе: как модель, которая доводит длинную задачу до конца сама, и подкрепляет заявку пятью разборами автономных прогонов.
95 миллиардов активных из 2,4 триллионов
Qwen3.8-Max собран по схеме Mixture-of-Experts из 2,4 трлн параметров на каждый запрос включается около 95 млрд, остальные простаивают. Архитектура наследует Qwen3.5. Контекст заявлен в миллион токенов: максимальный ввод 991 тыс., при включённом режиме размышлений 983 тыс., потолок ответа 131 тыс. в обоих режимах.
Модель принимает текст, изображения и видео, отвечает текстом. Параметр reasoning_effort даёт три ступени между скоростью и дотошностью. Совместимость двойная, формат Chat Completions от OpenAI и протокол Anthropic, поэтому Qwen3.8-Max подключается к Claude Code, Codex, OpenClaw, Qoder CLI и Qwen Code сменой адреса и идентификатора модели.
Шестнадцать дней и 265 коммитов
Главный акцент релиза - работа без человека рядом.
- В первом кейсе Qwen3.8-Max шестнадцать дней собирала консольную утилиту oh-my-cli: сама превращала пожелания пользователей в задачи на GitHub, брала их в работу, писала код, гоняла тесты и правила результат. К 30 июля в репозитории набралось 265 коммитов, 127 pull request и 151 issue.
- Во втором модели дали научную статью «Unified Data Selection for LLM Reasoning» без готового кода и попросили повторить результаты. За пять дней и около 125 часов расчётов Qwen3.8-Max написала 7600 строк, провела 33 обучения на GPU и воспроизвела все шесть основных результатов. Дальше она перебрала 18 собственных идей и обошла метод авторов на математическом тесте AIME24 на 2,7 пункта.
- Третий кейс ближе к спорту. На соревновании WWW2025 по распознаванию намерений в мультимодальных диалогах выступали 526 человеческих команд. Модель за сутки дообучила несколько языковых моделей под скриншоты товаров и собрала из них голосующий ансамбль, подняв точность с 0,60 до 0,853 за 45 отправок. Победы нет, но верхняя треть таблицы за сутки без человека - результат показательный.
От 8298 вентилей до 678
Два оставшихся сценария растянуты на сотни шагов.
- В первом Qwen3.8-Max проектировала криптографический блок для шифрования. Эффективность схемы меряют числом логических вентилей - элементарных ячеек внутри чипа, и чем их меньше, тем компактнее результат. Стартовый вариант работал, но был громоздким: 8298 вентилей. Примерно за 500 итераций модель ужала его до 678, а после автоматической разводки в открытом OpenROAD площадь кристалла сократилась со 106×106 до 46×46 микрометров.
- Второй сценарий - симулятор торгового года на обезличенных данных Taobao и Tmall. Модель ведёт несколько магазинов со стартовым капиталом в 100 тыс. юаней: закупает товар, договаривается с поставщиками обычным текстом, меняет цены, разбирает возвраты и переживает тайфуны с сорванными поставками, а в пуле поставщиков спрятаны 152 мошенника. Qwen3.8-Max закончила год с 416 252 юанями, на 38 % выше идущей следом GLM 5.2 и в два с половиной раза лучше предшественника Qwen3.7-Max.
Двести страниц и сто часов видео
Зрение в Qwen3.8-Max встроено в цикл планирования, а не работает отдельным распознавателем картинок. Alibaba заявляет обработку документов на 200 с лишним страниц и видео длиннее ста часов.
Вместе с моделью команда показала бенчмарк RecreationBench: агенту дают работающее приложение без доступа к исходникам и просят собрать его копию, наблюдая за оригиналом только через клики и клавиатуру. Проверка идёт на Ubuntu, macOS, Windows, Android и в вебе. Отдельно вышла библиотека Qwen-MM-Plugins, которая добавляет сторонним агентским системам работу с изображениями, видео и визуальную память.
Два доллара за миллион входных
Qwen3.8-Max уже доступна через QwenCloud и чат Qwen Studio. Тарифы объявлены такие:
- входные токены - $2 за миллион;
- выходные - $6 за миллион;
- чтение из неявного кеша - $0,25 за миллион;
- создание явного кеша - $2,50, чтение из него - $0,17.
Кешированный ввод выходит в восемь раз дешевле свежего, так что на счёт сильнее влияет стабильность начала промпта, чем его длина. Лимиты - 2 млн токенов и 15 тыс. запросов в минуту. Относительно прайса Qwen3.7-Max, где стояли $2,50 и $7,50, новый флагман подешевел ровно на 20 % по обеим позициям. Старшая модель, которая стоит меньше предыдущей, - редкий случай в линейках такого класса.
Сторонние агенты подхватили Qwen3.8-Max в день анонса. Кодовый агент Command Code запустил её в тарифе Go тем же утром, назвав те же $2 и $6; сам сервис изначально строится вокруг открытых моделей, так что обещанные веса ему интереснее API. Веса Qwen3.8-Max и Qwen3.8-27B ждут на следующей неделе на Hugging Face и ModelScope, лицензию Alibaba пока не назвала.
Цифры Alibaba меряет сама
Компания выложила таблицу бенчмарков, и картина в ней неровная. Qwen3.8-Max берёт 86,6 на Terminal-Bench 2.1, обходя Claude Opus 4.8 и Claude Fable 5 с их 84,6, но уступая GPT-5.6 Sol с 88,8. Лидирует на PaperBench с 93,0 и на IFBench с 82,8. А вот на SWE-bench Pro у неё 67,7 против 80,0 у Fable 5, на FrontierSWE - 73,5 против 88,8. Разрыв на инженерных тестах заметный, и в подаче релиза он звучит тише остальных цифр.
Все замеры внутренние, независимой проверки пока нет. Мультимодальную таблицу Alibaba сравнивает не с прошлым флагманом, а с более лёгкой Qwen3.7-Plus, отчего прирост поколения выглядит крупнее. Зато кривую обучения с подкреплением компания показала честно: сводный индекс поднялся с 0,474 до 0,725 примерно на четырёх тысячах тренировочных сред, а дальше пошёл вниз, до 0,719 и 0,689. Наращивание сред упирается в потолок, и Qwen это не спрятал.
Настоящий релиз - это 27B
Открытие весов модели класса Max - событие, но пользоваться им будут единицы. Чекпоинт на 2,4 трлн параметров разворачивается на кластере из нескольких узлов. Реальная точка входа для тех, кто ставит модель у себя, - Qwen3.8-27B, и именно её загрузки покажут, сработал ли расчёт.
Kimi K3 от Moonshot вышла с открытыми весами 27 июля, и независимые тесты тогда заметно охладили заявленные производителем цифры. С Qwen3.8-Max проверка начнётся на следующей неделе, как только модель попадёт в сторонние руки.