CoreTech

Qwen-Image-2.1

علی‌بابا از مدل تصویر ساز Qwen-Image-2.1 با معماری ۷ میلیارد پارامتری رونمایی کرد

ابوالفضل | ۵ ساعت پیش

Qwen-Image-2.1 با معماری ۷ میلیارد پارامتری، تولید و ویرایش تصویر را در یک مدل واحد ترکیب می‌کند و حالا از ساخت تصاویر شفاف نیز به‌صورت بومی پشتیبانی دارد. این مدل جدید خانواده Qwen با تمرکز هم‌زمان بر کیفیت، سرعت استنتاج و هزینه محاسباتی معرفی شده و می‌تواند از تولید تصویر معمولی تا ویرایش لایه‌های شفاف و جداسازی سوژه از عکس را انجام دهد.

یکی از تغییرات مهم Qwen-Image-2.1، معماری سبک آن است که در بخش تولید بصری از ۳۲ لایه Single-Stream DiT و ۷ میلیارد پارامتر تشکیل می‌شود. با وجود ابعاد نسبتاً کوچک، این مدل برای ارائه کیفیت بالای تولید تصویر طراحی شده است. در مقایسه Qwen-Image-Bench نیز عملکرد آن در کنار مدل‌های متن‌باز و بسته بررسی شده تا جایگاه کیفیت تولید آن مشخص شود.

مقایسه‌ی Qwen-Image-2.1 با رقبا:

Qwen-Image-2.1 علاوه بر تولید تصویر، برای ویرایش‌های چندمرحله‌ای و چندمنبعی نیز بهینه شده است و امکان استفاده از حداکثر ۱۰ تصویر مرجع را فراهم می‌کند. کاربر می‌تواند ویرایش‌های محلی را مشخص کند و مدل برای حفظ ظاهر افراد و محصولات عملکرد بهتری ارائه می‌دهد. این قابلیت‌ها طیف گسترده‌ای از کارهای ویرایشی را پوشش می‌دهند و مدل را برای سناریوهای متنوع آماده می‌کنند.

برای کاهش هزینه و مصرف حافظه هنگام ویرایش با چند تصویر ورودی، Qwen-Image-2.1 از معماری توجه با دانه‌بندی ترکیبی استفاده می‌کند. متن، شامل پیشوند سیستمی و دستورهای ویرایش، با ماسک علّی در سطح توکن پردازش می‌شود؛ در مقابل، تولید تصویر از ماسک در سطح قطعه استفاده می‌کند. همچنین KV Cache به مدل اجازه می‌دهد تصاویر ورودی و دستورهای ویرایش را پس از محاسبه اولیه به‌عنوان زمینه ثابت دوباره استفاده کند.

پشتیبانی بومی از شفافیت نیز یکی از قابلیت‌های اصلی این نسخه است و Qwen در دسامبر ۲۰۲۵ مدل Qwen-Image-Layered را به‌عنوان مدلی اختصاصی برای تولید تصاویر شفاف معرفی کرده بود، اما Qwen-Image-2.1 این قابلیت را در یک مدل واحد ادغام می‌کند. در این معماری، پرامپت تعیین می‌کند خروجی به شکل یک تصویر معمولی باشد یا تصویری که کانال شفافیت دارد و امکان ویرایش لایه‌های شفاف نیز فراهم است.

این مجموعه قابلیت‌ها باعث می‌شود Qwen-Image-2.1 تولید تصویر، شفافیت و ویرایش را در یک مدل فشرده کنار هم قرار دهد. بهبود نورپردازی پرتره، تایپوگرافی و جزئیات ظریف نیز از دیگر تغییرات این نسخه است و هدف آن ارائه بافت‌های واقع‌گرایانه‌تر و ظاهر بصری دقیق‌تر عنوان شده است. Qwen این مدل را برای طراحی، تولید محتوا، تجارت الکترونیک و روایت بصری کاربردی می‌داند.

نمونه تصاویر رسمی تولید/ویرایش شده با Qwen-Image-2.1:

در بالا و ادامه نمونه تصاویر تولید شده‌‌ی شفاف را تماشا می‌کنید. (توضيحات هر تصویر در بخش پایین)

فراتر از سوژه‌های تکی، این مدل می‌تواند تصاویر شفاف پیچیده‌تری متشکل از چندین عنصر تولید کند و امکانات بیشتری برای طراحی و ساخت دارایی‌های گرافیکی فراهم می‌کند.

با یکپارچه‌سازی تولید و ویرایش، Qwen-Image-2.1 امکان ویرایش مستقیم تصاویر شفاف را نیز فراهم می‌کند. برای مثال، می‌تواند حالت چهره سوژه را تغییر دهد و پس‌زمینه شفاف را حفظ کند. تصویر ورودی در سمت چپ و نتیجه ویرایش‌شده در سمت راست قرار دارد.

متن داخل یک لایه شفاف نیز قابل ویرایش است. در مثال بالا، عبارت «BLOOM» با «Qwen-Image» جایگزین شده است.

این قابلیت برای عکس‌های واقعی نیز کاربرد دارد. مدل می‌تواند سوژه موردنظر را از یک تصویر RGB به‌صورت یک لایه RGBA با پس‌زمینه شفاف استخراج کند تا استفاده مجدد از عناصر در طراحی و ترکیب‌بندی‌های بعدی آسان‌تر شود.

Qwen-Image-2.1 از حداکثر ۱۰ تصویر مرجع پشتیبانی می‌کند و می‌تواند چندین سوژه و عنصر را در یک ترکیب منسجم کنار هم قرار دهد. در مثال پرتره گروهی بالا، ۶ پرتره مجزا در سمت چپ در یک عکس واحد ترکیب شده‌اند.

برای طراحی داخلی، مدل می‌تواند از ۱۰ تصویر مبلمان و لوازم دکوراسیون برای ایجاد چیدمان کامل یک اتاق استفاده کند.

در مثال اول، از دایره‌هایی با رنگ‌های مختلف برای مشخص‌کردن هم‌زمان سه ناحیه استفاده شده است: «ساعت فلزی داخل دایره آبی را حذف کن، موهای داخل دایره قرمز را مشکی کن و ناحیه داخل دایره سبز را با لباس خواب لینن طوسی آستین‌کوتاه جایگزین کن.» تصویر حاشیه‌نویسی‌شده در سمت چپ و نتیجه در سمت راست است.

حاشیه‌گذاری با نقاشی نیز روش دیگری برای مشخص‌کردن یک ناحیه است. در این مثال، مدل یک غواص را به ناحیه‌ای که در سمت راست تصویر ورودی با رنگ سفید مشخص شده، اضافه می‌کند.

دایره‌ها و حاشیه‌گذاری‌های نقاشی‌شده بخشی از محتوای اصلی تصویر را می‌پوشانند. برای حفظ کامل تصویر ورودی، Qwen-Image-2.1 می‌تواند تصویر اصلی و یک ماسک جداگانه را به‌عنوان دو ورودی دریافت کند. در مثال زیر، از مدل خواسته شده با استفاده از این دو تصویر، یک کابوی سوار بر اسب ایجاد کند و نتیجه:

بهبود حفظ جزئیات روی هویت چهره و ثبات محصولات تمرکز دارد. در تصاویر پرتره، مدل ویژگی‌های چهره را بهتر حفظ می‌کند تا هویت فرد در ویرایش‌های مختلف ثابت‌تر باقی بماند. در هر جفت تصویر، ورودی در سمت چپ و نتیجه ویرایش‌شده در سمت راست قرار دارد.

در ویرایش محصولات، مدل تلاش می‌کند متن، بافت و شکل محصول را حفظ کند تا ویژگی‌های اصلی آن در تصویر جدید ثابت باقی بماند.

Qwen-Image-2.1 برای تولید اینفوگرافیک، می‌توان یک عکس از مدل را به ترکیبی دقیق و سرشار از اطلاعات گسترش داد.

Qwen-Image-2.1 کیفیت بصری را بیش از پیش بهبود داده و تمرکز ویژه‌ای بر تایپوگرافی و پرتره‌ها دارد. رندر متن علاوه بر محتوای آن، سبک فونت، چیدمان و ارتباط آن با ترکیب‌بندی کلی را نیز در نظر می‌گیرد. نمونه‌های زیر رندر متن در شرایط مختلف را نشان می‌دهند.

در تصاویر پرتره، نورپردازی بهتر و جزئیات ظریف‌تر باعث می‌شوند تصاویر تولیدشده واقع‌گرایانه‌تر به نظر برسند.

منبع

ابوالفضل | ۵ ساعت پیش

دیدگاهتان را بنویسید