
علیبابا Qwen-Image 3.0 معرفی شد؛ تولید اینفوگرافیکهای پیچیده و متن ۱۰ پیکسلی در یک مرحله
علیبابا از نسل سوم مدل تولید تصویر خود با نام Qwen-Image 3.0 رونمایی کرده است؛ مدلی که نسبت به نسخههای پیشین تمرکز بیشتری بر انجام وظایف کاربردی دارد و میتواند چیدمانهای پیچیده را تنها در یک مرحله ایجاد کند. این مدل از پرامپتهایی با حداکثر ۴۵۰۰ توکن پشتیبانی میکند، قادر به تولید متن خوانا با اندازه ۱۰ پیکسل است و بهصورت بومی از ۱۲ زبان مختلف پشتیبانی میکند. همچنین هدف آن فراتر از تولید تصاویر زیبا بوده و برای پروژههایی مانند صفحهآرایی روزنامه، استوریبورد و برگههای آزمون طراحی شده است.

بر اساس توضیحات تیم Qwen، فلسفه توسعه این مدل در هر نسل تغییر کرده است، نسخه نخست تنها بر دقت تمرکز داشت و در نسخه دوم، ویژگیهایی مانند دقت، تنوع، کامل بودن، زیبایی و اصالت به اهداف پروژه اضافه شدند. اما در Qwen-Image 3.0 این مسیر با انتخاب واژه واقعی وارد مرحله تازهای شده است؛ موضوعی که نشان میدهد تمرکز اصلی مدل اکنون انجام وظایف عملی و تولید خروجیهای قابل استفاده در سناریوهای واقعی است.
یکی از مهمترین قابلیتهای Qwen-Image 3.0 پشتیبانی از پرامپتهایی با طول حداکثر ۴۵۰۰ توکن است؛ به گفته توسعهدهندگان، این ظرفیت باعث میشود مدل بتواند چیدمانهای بسیار متراکم و چندبخشی را در یک مرحله تولید کند و دیگر نیازی به ساخت تصویر از طریق ترکیب چند خروجی مجزا نداشته باشد. در نتیجه طراحی پروژههایی با ساختارهای پیچیده و محتوای فراوان سادهتر و یکپارچهتر انجام میشود.
برای نمایش این توانایی، تیم Qwen نمونهای منتشر کرده که یک شبکه ۳×۳ شامل ۹ اینفوگرافیک مستقل را در یک تصویر جای داده است. هر بخش متن فرمول و تصویرسازی اختصاصی خود را دارد و موضوعات متنوعی را پوشش میدهد. از جمله این موارد میتوان به فاصله ایمن خودروها در نزدیکی تونلها، خطوط عمود، رابطه احساس و عقل در آموزههای کنفوسیوس و سرعت جدا شدن یک پرتابه از استوانه در حال چرخش اشاره کرد.

پنلهای دیگر این نمونه از Qwen-Image 3.0 نیز موضوعات علمی و آموزشی متنوعی را در بر میگیرند، چرخه زندگی انگل فلوک کبدی، علت درد سمت راست قفسه سینه، قضیههای سیلو برای گروههای مرتبه ۷۲، سازوکار کنترلهای داخلی در بانکها و ساختار DNA در سلولهای گیاهی و جانوری از دیگر مباحثی هستند که در این مجموعه نمایش داده شدهاند. به گفته تیم توسعهدهنده همه این موارد تنها در یک مرحله تولید شدهاند.
Qwen-Image 3.0 علاوه بر چیدمانهای چندبخشی، توانایی تولید رابطهای کاربری تودرتو را نیز به نمایش گذاشته است چرا که یکی از نمونههای منتشرشده، پنجرهای از VSCode را نشان میدهد که درون آن صفحه Qwen Chat قرار دارد. داخل این صفحه نیز یک گفتوگوی WeChat دیده میشود که پوستری درباره روش تهیه قهوه پوراور را نمایش میدهد و نمونهای از مدیریت ساختارهای چندلایه توسط مدل محسوب میشود.
یکی دیگر از قابلیتهایی که تیم Qwen روی آن تأکید کرده، تولید متنهای بسیار کوچک اما خوانا است و به گفته توسعهدهندگان، این مدل میتواند نوشتههایی با اندازه تنها ۱۰ پیکسل را نیز بهگونهای تولید کند که همچنان قابل خواندن باشند. یکی از نمونههای ارائهشده، اینفوگرافیکی درباره کوسهنهنگ است که حجم زیادی از متن را در فضایی محدود و با وضوح مناسب نمایش میدهد.

نمونه دیگری که برای نمایش این تواناییِ Qwen-Image 3.0 منتشر شده، صفحهای کامل از یک مقاله خیالی درباره هندسه جبری است. این صفحه شامل معادلات چندخطی LaTeX با زیرنویس، بالانویس، آکولاد، کسر، عملگرهای جمع و حاصلضرب است. علاوه بر این، تیم Qwen نمونههایی از یک صفحه شبیهسازیشده روزنامه و یادداشتهای دستنویس قرمز رنگ را نیز منتشر کرده که ظاهری مشابه اصلاحات یک معلم دارند.
Qwen-Image 3.0 تنها روی تولید متن و چیدمان تمرکز نکرده و کیفیت بصری تصاویر نیز یکی از محورهای اصلی توسعه آن بوده است، به گفته تیم سازنده، این مدل میتواند در تصاویر پرتره و اشیاء، جزئیاتی مانند منافذ پوست، بافت طبیعی پوست و تارهای مجزای مو را با دقت بالایی نمایش دهد تا خروجیها به تصاویر واقعی نزدیکتر شوند.
در یکی از نمونههای ویرایش تصویر با Qwen-Image 3.0، مدل وظیفه ترمیم یک نقاشی سنتی مرکبی آسیبدیده از عقابهای در حال نبرد را بر عهده میگیرد. بخشهای از دسترفته تصویر با حفظ سبک قلممو، نوع سایهپردازی مرکب و هماهنگی با قسمتهای سالم بازسازی میشوند؛ بهگونهای که نتیجه نهایی با سبک اثر اصلی همخوانی داشته باشد و تفاوت بخشهای ترمیمشده بهسادگی قابل تشخیص نباشد.
تیم Qwen سومین حوزه تمرکز این نسخه را دانش عمیق توصیف میکند و این مدل بهصورت بومی از ۱۲ زبان (شامل فارسی نمیشود) پشتیبانی میکند. نمونههای منتشرشده همچنین نشان میدهند که مدل قادر است رابطهای کاربری وبسایتها، بازیها و پخشهای زنده را نیز بازسازی کند و ساختار ظاهری آنها را با جزئیات قابل توجه بازآفرینی کند.

در یکی دیگر از نمونههای ویرایش، تصویر یک حشره به یک صفحه کامل شناسایی تبدیل میشود. این خروجی شامل ردهبندی علمی، برچسبگذاری بخشهای مختلف بدن، نماهای بزرگنماییشده از جزئیات و همچنین نوار مقیاس است. به گفته Qwen، مدل همچنین میتواند از دادههای زنده اینترنت استفاده کند و بر اساس آنها خروجیهایی مانند پیشبینی وضعیت آبوهوای شهر هانگژو را تولید کند.
یکی دیگر از نمونههای منتشرشده، نقاش مشهور چینی Qi Baishi را در کنار Vincent van Gogh داخل یک استودیوی شبیهسازیشده پخش زنده به تصویر میکشد. این مثال برای نمایش توانایی مدل در ترکیب شخصیتها و صحنههای مختلف ارائه شده است. همچنین نمونههای منتشرشده نشان میدهند که Qwen-Image 3.0 میتواند در کنار تولید تصویر، از اطلاعات بهروز نیز برای ساخت برخی خروجیها استفاده کند.

علیبابا تنها چند ماه پس از معرفی Qwen-Image 2.0 در ماه مه، نسل سوم این مدل را رونمایی کرده است و گزارش فنی نسخه قبلی عمدتاً بر افزایش بهرهوری فرایند آموزش و استنتاج تمرکز داشت و از نسخهای سریعتر خبر میداد که برای تولید هر تصویر تنها به ۴ مرحله نیاز داشت؛ در حالی که نسخه استاندارد همان مدل این کار را در ۴۰ مرحله انجام میداد.
براساس نتایج منتشرشده از پلتفرم اختصاصی ارزیابی Alibaba، مدل Qwen-Image 2.0 در رتبهبندی داخلی این شرکت، پایینتر از GPT-Image 2 متعلق به OpenAI و Nano Banana Pro ساخت گوگل قرار گرفت. در حال حاضر نیز به نظر میرسد Qwen-Image 3.0 تنها از طریق API و با دسترسی مبتنی بر دعوتنامه در اختیار کاربران قرار گرفته و انتظار میرود بهزودی وارد برنامههای رسمی مانند Qwen Chat شود.
با وجود پیشرفت قابل توجه این مدل در تولید متن، چیدمانهای پیچیده و بازسازی رابطهای کاربری، ارزش عملی برخی از نمونههای ارائهشده همچنان محل بحث است. پژوهشگران معمولاً مقالات علمی را با LaTeX مینویسند و صفحهآرایی میکنند، نه اینکه آنها را بهصورت تصویر تولید کنند. به همین دلیل، چنین خروجیهایی احتمالاً بیشتر برای ساخت ماکتها و پیشنمایشهای بصری مناسب خواهند بود تا نسخه نهایی اسناد. قالبهای قابل جستوجو و قابل ویرایش نیز همچنان برای فرایندهای تولیدی انعطاف بیشتری ارائه میکنند، هرچند این نمونهها نشان میدهند فناوری رندر متن در مدلهای تصویری تا چه اندازه پیشرفت کرده است.




