
علیبابا از مدل تصویر ساز Qwen-Image-2.1 با معماری ۷ میلیارد پارامتری رونمایی کرد
Qwen-Image-2.1 با معماری ۷ میلیارد پارامتری، تولید و ویرایش تصویر را در یک مدل واحد ترکیب میکند و حالا از ساخت تصاویر شفاف نیز بهصورت بومی پشتیبانی دارد. این مدل جدید خانواده Qwen با تمرکز همزمان بر کیفیت، سرعت استنتاج و هزینه محاسباتی معرفی شده و میتواند از تولید تصویر معمولی تا ویرایش لایههای شفاف و جداسازی سوژه از عکس را انجام دهد.
یکی از تغییرات مهم Qwen-Image-2.1، معماری سبک آن است که در بخش تولید بصری از ۳۲ لایه Single-Stream DiT و ۷ میلیارد پارامتر تشکیل میشود. با وجود ابعاد نسبتاً کوچک، این مدل برای ارائه کیفیت بالای تولید تصویر طراحی شده است. در مقایسه Qwen-Image-Bench نیز عملکرد آن در کنار مدلهای متنباز و بسته بررسی شده تا جایگاه کیفیت تولید آن مشخص شود.
مقایسهی Qwen-Image-2.1 با رقبا:

Qwen-Image-2.1 علاوه بر تولید تصویر، برای ویرایشهای چندمرحلهای و چندمنبعی نیز بهینه شده است و امکان استفاده از حداکثر ۱۰ تصویر مرجع را فراهم میکند. کاربر میتواند ویرایشهای محلی را مشخص کند و مدل برای حفظ ظاهر افراد و محصولات عملکرد بهتری ارائه میدهد. این قابلیتها طیف گستردهای از کارهای ویرایشی را پوشش میدهند و مدل را برای سناریوهای متنوع آماده میکنند.
برای کاهش هزینه و مصرف حافظه هنگام ویرایش با چند تصویر ورودی، Qwen-Image-2.1 از معماری توجه با دانهبندی ترکیبی استفاده میکند. متن، شامل پیشوند سیستمی و دستورهای ویرایش، با ماسک علّی در سطح توکن پردازش میشود؛ در مقابل، تولید تصویر از ماسک در سطح قطعه استفاده میکند. همچنین KV Cache به مدل اجازه میدهد تصاویر ورودی و دستورهای ویرایش را پس از محاسبه اولیه بهعنوان زمینه ثابت دوباره استفاده کند.

پشتیبانی بومی از شفافیت نیز یکی از قابلیتهای اصلی این نسخه است و Qwen در دسامبر ۲۰۲۵ مدل Qwen-Image-Layered را بهعنوان مدلی اختصاصی برای تولید تصاویر شفاف معرفی کرده بود، اما Qwen-Image-2.1 این قابلیت را در یک مدل واحد ادغام میکند. در این معماری، پرامپت تعیین میکند خروجی به شکل یک تصویر معمولی باشد یا تصویری که کانال شفافیت دارد و امکان ویرایش لایههای شفاف نیز فراهم است.
این مجموعه قابلیتها باعث میشود Qwen-Image-2.1 تولید تصویر، شفافیت و ویرایش را در یک مدل فشرده کنار هم قرار دهد. بهبود نورپردازی پرتره، تایپوگرافی و جزئیات ظریف نیز از دیگر تغییرات این نسخه است و هدف آن ارائه بافتهای واقعگرایانهتر و ظاهر بصری دقیقتر عنوان شده است. Qwen این مدل را برای طراحی، تولید محتوا، تجارت الکترونیک و روایت بصری کاربردی میداند.
نمونه تصاویر رسمی تولید/ویرایش شده با Qwen-Image-2.1:



در بالا و ادامه نمونه تصاویر تولید شدهی شفاف را تماشا میکنید. (توضيحات هر تصویر در بخش پایین)


فراتر از سوژههای تکی، این مدل میتواند تصاویر شفاف پیچیدهتری متشکل از چندین عنصر تولید کند و امکانات بیشتری برای طراحی و ساخت داراییهای گرافیکی فراهم میکند.


با یکپارچهسازی تولید و ویرایش، Qwen-Image-2.1 امکان ویرایش مستقیم تصاویر شفاف را نیز فراهم میکند. برای مثال، میتواند حالت چهره سوژه را تغییر دهد و پسزمینه شفاف را حفظ کند. تصویر ورودی در سمت چپ و نتیجه ویرایششده در سمت راست قرار دارد.


متن داخل یک لایه شفاف نیز قابل ویرایش است. در مثال بالا، عبارت «BLOOM» با «Qwen-Image» جایگزین شده است.


این قابلیت برای عکسهای واقعی نیز کاربرد دارد. مدل میتواند سوژه موردنظر را از یک تصویر RGB بهصورت یک لایه RGBA با پسزمینه شفاف استخراج کند تا استفاده مجدد از عناصر در طراحی و ترکیببندیهای بعدی آسانتر شود.

Qwen-Image-2.1 از حداکثر ۱۰ تصویر مرجع پشتیبانی میکند و میتواند چندین سوژه و عنصر را در یک ترکیب منسجم کنار هم قرار دهد. در مثال پرتره گروهی بالا، ۶ پرتره مجزا در سمت چپ در یک عکس واحد ترکیب شدهاند.

برای طراحی داخلی، مدل میتواند از ۱۰ تصویر مبلمان و لوازم دکوراسیون برای ایجاد چیدمان کامل یک اتاق استفاده کند.


در مثال اول، از دایرههایی با رنگهای مختلف برای مشخصکردن همزمان سه ناحیه استفاده شده است: «ساعت فلزی داخل دایره آبی را حذف کن، موهای داخل دایره قرمز را مشکی کن و ناحیه داخل دایره سبز را با لباس خواب لینن طوسی آستینکوتاه جایگزین کن.» تصویر حاشیهنویسیشده در سمت چپ و نتیجه در سمت راست است.


حاشیهگذاری با نقاشی نیز روش دیگری برای مشخصکردن یک ناحیه است. در این مثال، مدل یک غواص را به ناحیهای که در سمت راست تصویر ورودی با رنگ سفید مشخص شده، اضافه میکند.


دایرهها و حاشیهگذاریهای نقاشیشده بخشی از محتوای اصلی تصویر را میپوشانند. برای حفظ کامل تصویر ورودی، Qwen-Image-2.1 میتواند تصویر اصلی و یک ماسک جداگانه را بهعنوان دو ورودی دریافت کند. در مثال زیر، از مدل خواسته شده با استفاده از این دو تصویر، یک کابوی سوار بر اسب ایجاد کند و نتیجه:







بهبود حفظ جزئیات روی هویت چهره و ثبات محصولات تمرکز دارد. در تصاویر پرتره، مدل ویژگیهای چهره را بهتر حفظ میکند تا هویت فرد در ویرایشهای مختلف ثابتتر باقی بماند. در هر جفت تصویر، ورودی در سمت چپ و نتیجه ویرایششده در سمت راست قرار دارد.






در ویرایش محصولات، مدل تلاش میکند متن، بافت و شکل محصول را حفظ کند تا ویژگیهای اصلی آن در تصویر جدید ثابت باقی بماند.




Qwen-Image-2.1 برای تولید اینفوگرافیک، میتوان یک عکس از مدل را به ترکیبی دقیق و سرشار از اطلاعات گسترش داد.



Qwen-Image-2.1 کیفیت بصری را بیش از پیش بهبود داده و تمرکز ویژهای بر تایپوگرافی و پرترهها دارد. رندر متن علاوه بر محتوای آن، سبک فونت، چیدمان و ارتباط آن با ترکیببندی کلی را نیز در نظر میگیرد. نمونههای زیر رندر متن در شرایط مختلف را نشان میدهند.


در تصاویر پرتره، نورپردازی بهتر و جزئیات ظریفتر باعث میشوند تصاویر تولیدشده واقعگرایانهتر به نظر برسند.




