Alibaba открыла веса Qwen3.8-Flash-Next и показала, из чего будет собрана Qwen4
Qwen3.8-Flash-Next — не очередная модель в линейке, а витрина инженерных решений. Команда Qwen прямо называет её предварительным показом архитектуры Qwen4 и выкладывает веса, чтобы решения можно было пощупать до выхода основной линейки. Параллельно Alibaba открыла продакшен-версию Qwen3.8-Flash через собственное облако.
Активны шесть миллиардов из 125
Qwen3.8-Flash-Next построена по схеме смеси экспертов. Модель большая, но на каждый токен включается лишь малая её часть. В основе 125 миллиардов параметров, разложенных на 512 экспертов, и на обработку одного токена запускаются десять выбранных плюс один общий. Работают в итоге около шести миллиардов параметров.
Внимание тоже перекроено. Три слоя из каждых четырёх используют Gated DeltaNet — линейный механизм, который считает контекст заметно дешевле обычного. Четвёртый слой отдан собственной разработке Qwen Sparse Attention, где лёгкий индексатор выбирает из контекста только нужные куски, а не просматривает его целиком. Родной контекст — 262 тысячи токенов, с растяжкой методом YaRN он доходит до миллиона.
Словарь на 20 миллионов сочетаний
Самое необычное в Qwen3.8-Flash-Next лежит рядом с основной моделью. На втором слое подключена таблица из 20 миллионов устойчивых сочетаний слов — пар и троек, которые модель не вычисляет заново, а просто достаёт готовыми. Весит эта таблица 51 миллиард параметров и на видеокарте не живёт. Её держат в обычной оперативной памяти и подгружают заранее.
Приём даёт модели дополнительную ёмкость почти без расхода дорогой видеопамяти. Рядом работает модуль предсказания сразу нескольких токенов на 4 миллиарда параметров, который ускоряет генерацию. На диске всё вместе занимает 180 миллиардов параметров — 172 ГиБ в формате FP8 и 335 ГиБ в BF16.
Вдевятеро дешевле в обучении
Экономику Alibaba выносит вперёд самой архитектуры. Обучение Qwen3.8-Flash-Next обошлось примерно в девять раз дешевле, чем обучение более крупной Qwen3.7-Plus, и при этом результаты компания заявляет выше.
Продакшен-версия Qwen3.8-Flash в облаке QwenCloud стоит $0,16 за миллион входных токенов и $0,47 за миллион выходных. Это примерно двенадцатая часть цены старшей Qwen3.8-Max. Для агентных сценариев, где модель гоняет длинные цепочки вызовов, разница в двенадцать раз важнее лишнего процента на бенчмарке.
Бенчмарки Alibaba против Opus 4.6
Опубликованные цифры выглядят внушительно. Qwen3.8-Flash-Next обходит Claude Opus 4.6 Max на задачах программирования и офисной автоматизации:
- SWE-bench Pro — 62,5 против 53,4;
- LiveCodeBench v6 — 91,9 против 88,8;
- CoWorkBench — 73,9 против 68,2;
- JobBench — 55,7 против 36,6;
- следование инструкциям — 81,3 против 62,5.
Отстаёт модель там, где нужны сложные рассуждения. На Humanity's Last Exam у неё 35,9 против 40,0 у Claude, а на Agents' Last Exam её обходит DeepSeek -V4-Flash.
Здесь нужно оговориться. Все цифры получены самой Alibaba на её собственных прогонах, набор бенчмарков компания подбирала сама, а по DeepSWE в отчёт пошёл лучший результат из двух разных методик замера. Это нормальная практика вендорских отчётов, но читать её стоит как заявку, которую предстоит проверять независимым замерщикам.
Три двери в Qwen3.8-Flash-Next
Веса лежат на Hugging Face и ModelScope, запускать модель рекомендуют через SGLang, vLLM или TokenSpeed. Локальный запуск упирается в железо — 172 ГиБ даже в сжатом формате означают серверную сборку, а не домашнюю видеокарту.
Второй путь — облако Alibaba, где работает продакшен-версия Qwen3.8-Flash по объявленным ценам за токены. Третий — сторонние площадки, которые обычно подключают свежие открытые модели в первые дни после релиза, и Qwen здесь не исключение.
Лицензия называется qwen-community-1.0, и это не Apache. Открытые веса тут не равны свободному использованию, так что перед коммерческим внедрением текст лицензии придётся прочитать целиком.
Дешёвый исполнитель для рутины
Для тех, кто гоняет ИИ на потоке задач, интерес Qwen3.8-Flash-Next держится на цене за токен, а не на строчках в таблице. Разбор выгрузок, переписывание описаний, сверка данных между таблицами, черновая обработка текстов — сценарии, где объём важнее последнего процента качества.
Проверять модель имеет смысл на своей типовой пачке задач, а не на бенчмарках Alibaba. Сравнение стоимости прогона и качества на собственных данных даст ответ быстрее любого отчёта.
Qwen4 покажет, сработала ли ставка
Двумя днями раньше похожую ставку сделала Z.ai со своей GLM-5.3-Flash — та же крайняя разреженность, тот же миллион токенов контекста, та же экономия на внимании. Разница в открытости цифр. Alibaba называет цену за токен прямо, а Z.ai поштучную стоимость так и не объявила.
Qwen3.8-Flash-Next остаётся черновиком, каким её и подают. Настоящую проверку архитектура пройдёт в Qwen4, где те же решения придётся масштабировать на флагман. До этого момента девятикратная экономия на обучении — цифра из отчёта компании, а не подтверждённый результат.