Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

3 мин
Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

Команда Qwen из Alibaba опубликовала веса Qwen-Image 2.1. Модель объединяет генерацию и редактирование изображений, работает в нативном разрешении 2K и умеет разрабатывать картинки с прозрачным фоном. Разработчики утверждают, что она обходит большинство закрытых конкурентов, хотя результаты пока получены на собственном бенчмарке Qwen.

Главная достоинство релиза в том, что схема имеет 7 млрд параметров. Столько содержит генеративный компонент модели, построенный на 32-слойном диффузионном трансформере DiT. Тем не менее называть всю систему семимиллиардной не совсем точно. Для обработки текста и исходных изображений она дополнительно использует визуально-языковую схема Qwen3-VL 8B.

Генерация и редактирование в одной модели

Qwen-Image 2.1 поддерживает обычную генерацию по тексту и редактирование готовых изображений через один пайплайн. За один запрос можно передать до десяти референсов. В частности, собрать групповой снимок из отдельных портретов, примерить одежду на человека или перенести предметы из нескольких фотографий в новый интерьер.

Локальные изменения можно задавать маской, нарисованной областью или обычным кругом вокруг нужного объекта. По заявлению разработчиков, схема старается сохранять внешность людей и особенности товаров при переносе между сценами.

Ещё одно заметное нововведение связано с форматом RGBA. Схема умеет сразу генерировать объекты на прозрачном фоне, извлекать предметы из фотографий и редактировать уже существующие прозрачные слои. Раньше для этого обычно приходилось отдельно удалять фон или использовать специализированную схема.

В документации приведены рекомендованные размеры от 2048 × 2048 пикселей для квадратных изображений до 2752 × 1536 для формата 16:9. Генерация по умолчанию занимает 40 шагов.

Зачем модели KV-кеш

При редактировании нескольких изображений значительная часть вычислений повторяется на каждом шаге диффузии. В Qwen-Image 2.1 исходные картинки и инструкции обрабатываются один раз, после чего промежуточные ключи и значения сохраняются в KV-кеше.

Для текста используется причинная маска на уровне отдельных токенов, а изображения обрабатываются более крупными блоками. Alibaba утверждает, что такая модель ускоряет работу с несколькими референсами и уменьшает лишние вычисления.

Архитектура также включает автоэнкодер с 16-кратным пространственным сжатием и поддержкой альфа-канала. Именно он позволяет модели работать с прозрачностью как с нативной частью изображения, а не как с результатом последующей обработки. Подробное описание архитектуры опубликовано на GitHub.

«Лучше закрытых моделей», но пока со звёздочкой

На Qwen-Image-Bench новая модель, по данным Alibaba, превосходит большинство протестированных закрытых систем. Авторы отдельно отмечают качество текста, портретного освещения, мелких деталей и реалистичных текстур.

Относиться к этому сравнению пока стоит осторожно. Бенчмарк создан самой командой Qwen, а независимые тесты модели ещё не появились. Поэтому корректнее говорить о заявленных результатах, а не о подтверждённом превосходстве над коммерческими генераторами.

Есть и иной важный нюанс. Веса доступны публично, но Qwen Research License разрешает использовать, изменять и распространять их только в некоммерческих целях, связанных с исследованиями или оценкой. Для коммерческого применения необходимо получить отдельную лицензию у Alibaba. Поэтому Qwen-Image 2.1 точнее называть моделью с открытыми весами, а не полноценным open source.

Где попробовать

Веса опубликованы на Hugging Face и ModelScope. С первого дня модель поддерживают Diffusers и ComfyUI, а для серверного запуска заявлена встраивание с vLLM-Omni и SGLang.

Что в результате?

Семимиллиардный генератор, нативная прозрачность и работа сразу с десятью референсами делают её хорошим таким вариантом для локальных экспериментов. Но коммерческим проектам перед скачиванием весов стоит начать не с выбора видеокарты, а с чтения лицензии.

Больше важных AI‑новостей в канале AI Native. Разбираем все, что связано с ИИ.

Читают сейчас

«Яндекс» назвал и наградил лауреатов международной премии Yandex ML Prize 2026

5 часов назад

«Яндекс» назвал и наградил лауреатов международной премии Yandex ML Prize 2026

«Яндекс» назвал и наградил 8 лауреатов (из НИУ ВШЭ, МФТИ, МГУ, ИТМО и НГУ) международной премии Yandex ML Prize, которые учат ИИ и ML тех, кто завтра будет создавать технологии. На премию было отправл

Техдиректор Microsoft Azure с помощью ИИ за два дня портировал на macOS старую утилиту для Windows

8 часов назад

Техдиректор Microsoft Azure с помощью ИИ за два дня портировал на macOS старую утилиту для Windows

Программист Microsoft Марк Руссинович, который в настоящее время является техническим директором Microsoft Azure, использовал искусственный интеллект, чтобы перенести инструмент Windows ZoomIt, которы

FAA запустило ИИ‑платформу для предиктивного управления воздушным движением

9 часов назад

FAA запустило ИИ‑платформу для предиктивного управления воздушным движением

Федеральное управление гражданской авиации США (FAA) запускает облачную ИИ‑платформу под названием SMART (Strategic Management of Airspace, Routes, and Trajectories) стоимостью $875 млн для предиктивн

Lenovo представила мобильный экран L16a

9 часов назад

Lenovo представила мобильный экран L16a

Lenovo представила новый 16-дюймовый мобильный монитор ThinkVision L16a. Он оснащён двумя портами USB‑C, поддерживает технологию Power Delivery и комплектуется регулируемой подставкой. Читать далее

Claude Code научился ознакомиться AGENTS.md

10 часов назад

Claude Code научился ознакомиться AGENTS.md

Anthropic добавили поддержку AGENTS.md в Claude Code 2.1.277. Теперь инструмент может применять совокупный файл с инструкциями для coding-агентов вместо отдельного CLAUDE.md. Ознакомиться далее