Alibaba выложила Qwen-Image-2.1 - картинки с прозрачным фоном из коробки

Команда Qwen выложила в открытый доступ Qwen-Image-2.1 - модель, которая рисует изображения сразу с прозрачным фоном и правит готовые картинки по обведённым кружком участкам. Веса появились на Hugging Face и ModelScope 20 сентября, но лицензия разрешает только исследования.
Alibaba выложила Qwen-Image-2.1 - картинки с прозрачным фоном из коробки

Qwen -Image-2.1 — новая открытая модель Alibaba , которая в одном пайплайне генерирует изображения по описанию и правит готовые. Команда Qwen подаёт релиз как самый компактный и экономичный в семействе. Веса выложены публично, демо работает бесплатно, а вот с лицензией придётся разбираться отдельно.

Прозрачный фон получается сразу, без вырезания

Главное, что отличает Qwen-Image-2.1 от предыдущих открытых генераторов, — нативная работа с альфа-каналом. Модель рисует объект на прозрачном фоне прямо по текстовому описанию, редактирует уже готовый прозрачный слой и вытаскивает предмет с обычной фотографии, сохраняя прозрачность вокруг него.

Для стикеров, иконок, логотипов и карточек товара это снимает целый шаг. Обычно картинку сначала генерируют, а фон убирают отдельным инструментом. Здесь прозрачность встроена в сам автокодировщик — 64-канальный RGBA с 16-кратным сжатием, поэтому альфа-канал не дорисовывается постобработкой.

Чтобы это включилось, модели нужно прямо сказать, что изображение прозрачное. Qwen рекомендует такую рамку запроса:

This is an RGBA image with transparency. Далее описание сцены. The image has alpha channel and the background is transparent.

Без этой формулировки модель отдаёт обычный кадр с фоном.

Десять референсов и правки кружком

Qwen-Image-2.1 принимает до десяти референсных изображений за один запрос. На показанных примерах из шести отдельных портретов собирается одна групповая фотография, а из пяти снимков — образ целиком: модель, одежда, обувь, сумка, шляпа. Тот же механизм закрывает виртуальную примерку и расстановку мебели в комнате.

Локальные правки задаются тремя способами:

  • обвести нужный участок кружком прямо на изображении;
  • закрасить его от руки;
  • подать отдельную маску.

Правки можно ставить в нескольких местах одновременно — убрать часы, перекрасить волосы и заменить одежду за один прогон. Лица и товары при этом обещают сохранять узнаваемость, а из более редких сценариев заявлены панорама, собранная из селфи, и раскадровка персонажа по трём его видам.

Семь миллиардов параметров вместо двадцати

Визуальная часть Qwen-Image-2.1 — 32 слоя Single-Stream DiT и около семи миллиардов параметров. Первое поколение Qwen-Image было примерно втрое крупнее, и уменьшение размера остаётся главным техническим аргументом релиза. Текст и входные картинки обрабатывает языковая модель Qwen3-VL 8B.

Скорость команда добирает за счёт повторного использования KV-кеша. Служебное представление текста и референсов считается один раз, на первом шаге, и дальше переиспользуется вместо полного пересчёта. Заметнее всего это на редактировании с несколькими входными изображениями, где раньше каждый шаг начинал работу заново.

По умолчанию модель рисует 2048×2048 за 40 шагов и поддерживает ходовые пропорции, включая 16:9 в разрешении 2752×1536.

Цифр по качеству Alibaba не показала

Qwen утверждает, что на собственном внутреннем бенчмарке модель обходит большинство закрытых решений. Ни названия этого бенчмарка, ни таблицы со счётом, ни имён конкурентов в релизе нет — ни на странице модели, ни в репозитории. Независимые замеры к моменту выхода тоже не появились.

Здесь нужно оговориться. Заявка «обходит закрытые модели» без единой цифры — обычная практика при открытых релизах, и проверяет её сообщество в первые же недели. Требований к видеопамяти Alibaba тоже не публикует, единственная подсказка в документации — выгрузка части модели в оперативную память для карт, которым не хватает своей.

Лицензия закрывает коммерческое применение

Веса Qwen-Image-2.1 распространяются под Qwen Research License. Она даёт бесплатное право использовать модель только для исследований и оценки, а для продукта, на котором зарабатывают, нужен отдельный договор с Hangzhou Tongyi Laboratory — заявку принимают по почте.

Отдельно лицензия требует указывать «Built with Qwen» в документации, если на модели что-то дообучали, и запрещает делать слово Qwen основным названием производного продукта. Для сравнения, DeepSeek в сентябре открыла V4.1 Flash под MIT, где коммерческое использование разрешено сразу. Открытые веса и открытая лицензия — разные вещи, и Qwen-Image-2.1 как раз тот случай.

Где взять веса и на чём запускать

Веса Qwen-Image-2.1 лежат на Hugging Face и ModelScope, там же работает демо-пространство, где модель можно попробовать без установки. Для локального запуска поддержка появилась день в день. Единый класс QwenImage21Pipeline в Diffusers покрывает и генерацию, и редактирование, для ComfyUI выложены готовые шаблоны рабочих процессов, серверные варианты собраны на vLLM и SGLang.

Официальные веса идут в BF16, для vLLM доступна экономная по памяти FP8-версия. Из железа помимо NVIDIA заявлены карты AMD через ROCm.

Прозрачный PNG без подписки, но и без права продавать

Для вебмастера и автора контента вся ценность Qwen-Image-2.1 сходится в одну вещь. Прозрачные PNG для иконок, карточек товара и обложек делаются одним запросом, без ручного вырезания фона и без подписки на сторонний сервис. Пока лицензия остаётся исследовательской, пользоваться этим можно для тестов и личных задач, а под коммерческий поток придётся либо договариваться с Alibaba, либо ждать следующей версии.

Судить о релизе по-настоящему получится в октябре, когда сообщество прогонит модель через открытые тесты и сравнит её с закрытыми генераторами. До этого сильная сторона у Qwen-Image-2.1 одна, зато проверяемая — прозрачность, которая работает без постобработки.

06:35
27
Нет комментариев. Ваш будет первым!