CoreTech

علی‌بابا Qwen-Image 3.0 معرفی شد؛ تولید اینفوگرافیک‌های پیچیده و متن ۱۰ پیکسلی در یک مرحله

پوریا | ۴ ساعت پیش

علی‌بابا از نسل سوم مدل تولید تصویر خود با نام Qwen-Image 3.0 رونمایی کرده است؛ مدلی که نسبت به نسخه‌های پیشین تمرکز بیشتری بر انجام وظایف کاربردی دارد و می‌تواند چیدمان‌های پیچیده را تنها در یک مرحله ایجاد کند. این مدل از پرامپت‌هایی با حداکثر ۴۵۰۰ توکن پشتیبانی می‌کند، قادر به تولید متن خوانا با اندازه ۱۰ پیکسل است و به‌صورت بومی از ۱۲ زبان مختلف پشتیبانی می‌کند. همچنین هدف آن فراتر از تولید تصاویر زیبا بوده و برای پروژه‌هایی مانند صفحه‌آرایی روزنامه، استوری‌بورد و برگه‌های آزمون طراحی شده است.

Qwen-Image 3

بر اساس توضیحات تیم Qwen، فلسفه توسعه این مدل در هر نسل تغییر کرده است، نسخه نخست تنها بر دقت تمرکز داشت و در نسخه دوم، ویژگی‌هایی مانند دقت، تنوع، کامل بودن، زیبایی و اصالت به اهداف پروژه اضافه شدند. اما در Qwen-Image 3.0 این مسیر با انتخاب واژه واقعی وارد مرحله تازه‌ای شده است؛ موضوعی که نشان می‌دهد تمرکز اصلی مدل اکنون انجام وظایف عملی و تولید خروجی‌های قابل استفاده در سناریوهای واقعی است.

یکی از مهم‌ترین قابلیت‌های Qwen-Image 3.0 پشتیبانی از پرامپت‌هایی با طول حداکثر ۴۵۰۰ توکن است؛ به گفته توسعه‌دهندگان، این ظرفیت باعث می‌شود مدل بتواند چیدمان‌های بسیار متراکم و چندبخشی را در یک مرحله تولید کند و دیگر نیازی به ساخت تصویر از طریق ترکیب چند خروجی مجزا نداشته باشد. در نتیجه طراحی پروژه‌هایی با ساختارهای پیچیده و محتوای فراوان ساده‌تر و یکپارچه‌تر انجام می‌شود.

برای نمایش این توانایی، تیم Qwen نمونه‌ای منتشر کرده که یک شبکه ۳×۳ شامل ۹ اینفوگرافیک مستقل را در یک تصویر جای داده است. هر بخش متن فرمول و تصویرسازی اختصاصی خود را دارد و موضوعات متنوعی را پوشش می‌دهد. از جمله این موارد می‌توان به فاصله ایمن خودروها در نزدیکی تونل‌ها، خطوط عمود، رابطه احساس و عقل در آموزه‌های کنفوسیوس و سرعت جدا شدن یک پرتابه از استوانه در حال چرخش اشاره کرد.

پنل‌های دیگر این نمونه از Qwen-Image 3.0 نیز موضوعات علمی و آموزشی متنوعی را در بر می‌گیرند، چرخه زندگی انگل فلوک کبدی، علت درد سمت راست قفسه سینه، قضیه‌های سیلو برای گروه‌های مرتبه ۷۲، سازوکار کنترل‌های داخلی در بانک‌ها و ساختار DNA در سلول‌های گیاهی و جانوری از دیگر مباحثی هستند که در این مجموعه نمایش داده شده‌اند. به گفته تیم توسعه‌دهنده همه این موارد تنها در یک مرحله تولید شده‌اند.

Qwen-Image 3.0 علاوه بر چیدمان‌های چندبخشی، توانایی تولید رابط‌های کاربری تو‌در‌تو را نیز به نمایش گذاشته است چرا که یکی از نمونه‌های منتشرشده، پنجره‌ای از VSCode را نشان می‌دهد که درون آن صفحه Qwen Chat قرار دارد. داخل این صفحه نیز یک گفت‌وگوی WeChat دیده می‌شود که پوستری درباره روش تهیه قهوه پوراور را نمایش می‌دهد و نمونه‌ای از مدیریت ساختارهای چندلایه توسط مدل محسوب می‌شود.

یکی دیگر از قابلیت‌هایی که تیم Qwen روی آن تأکید کرده، تولید متن‌های بسیار کوچک اما خوانا است و به گفته توسعه‌دهندگان، این مدل می‌تواند نوشته‌هایی با اندازه تنها ۱۰ پیکسل را نیز به‌گونه‌ای تولید کند که همچنان قابل خواندن باشند. یکی از نمونه‌های ارائه‌شده، اینفوگرافیکی درباره کوسه‌نهنگ است که حجم زیادی از متن را در فضایی محدود و با وضوح مناسب نمایش می‌دهد.

نمونه دیگری که برای نمایش این تواناییِ Qwen-Image 3.0 منتشر شده، صفحه‌ای کامل از یک مقاله خیالی درباره هندسه جبری است. این صفحه شامل معادلات چندخطی LaTeX با زیرنویس، بالانویس، آکولاد، کسر، عملگرهای جمع و حاصل‌ضرب است. علاوه بر این، تیم Qwen نمونه‌هایی از یک صفحه شبیه‌سازی‌شده روزنامه و یادداشت‌های دست‌نویس قرمز رنگ را نیز منتشر کرده که ظاهری مشابه اصلاحات یک معلم دارند.

Qwen-Image 3.0 تنها روی تولید متن و چیدمان تمرکز نکرده و کیفیت بصری تصاویر نیز یکی از محورهای اصلی توسعه آن بوده است، به گفته تیم سازنده، این مدل می‌تواند در تصاویر پرتره و اشیاء، جزئیاتی مانند منافذ پوست، بافت طبیعی پوست و تارهای مجزای مو را با دقت بالایی نمایش دهد تا خروجی‌ها به تصاویر واقعی نزدیک‌تر شوند.

در یکی از نمونه‌های ویرایش تصویر با Qwen-Image 3.0، مدل وظیفه ترمیم یک نقاشی سنتی مرکبی آسیب‌دیده از عقاب‌های در حال نبرد را بر عهده می‌گیرد. بخش‌های از دست‌رفته تصویر با حفظ سبک قلم‌مو، نوع سایه‌پردازی مرکب و هماهنگی با قسمت‌های سالم بازسازی می‌شوند؛ به‌گونه‌ای که نتیجه نهایی با سبک اثر اصلی همخوانی داشته باشد و تفاوت بخش‌های ترمیم‌شده به‌سادگی قابل تشخیص نباشد.

تیم Qwen سومین حوزه تمرکز این نسخه را دانش عمیق توصیف می‌کند و این مدل به‌صورت بومی از ۱۲ زبان (شامل فارسی نمی‌شود) پشتیبانی می‌کند. نمونه‌های منتشرشده همچنین نشان می‌دهند که مدل قادر است رابط‌های کاربری وب‌سایت‌ها، بازی‌ها و پخش‌های زنده را نیز بازسازی کند و ساختار ظاهری آن‌ها را با جزئیات قابل توجه بازآفرینی کند.

در یکی دیگر از نمونه‌های ویرایش، تصویر یک حشره به یک صفحه کامل شناسایی تبدیل می‌شود. این خروجی شامل رده‌بندی علمی، برچسب‌گذاری بخش‌های مختلف بدن، نماهای بزرگ‌نمایی‌شده از جزئیات و همچنین نوار مقیاس است. به گفته Qwen، مدل همچنین می‌تواند از داده‌های زنده اینترنت استفاده کند و بر اساس آن‌ها خروجی‌هایی مانند پیش‌بینی وضعیت آب‌وهوای شهر هانگژو را تولید کند.

یکی دیگر از نمونه‌های منتشرشده، نقاش مشهور چینی Qi Baishi را در کنار Vincent van Gogh داخل یک استودیوی شبیه‌سازی‌شده پخش زنده به تصویر می‌کشد. این مثال برای نمایش توانایی مدل در ترکیب شخصیت‌ها و صحنه‌های مختلف ارائه شده است. همچنین نمونه‌های منتشرشده نشان می‌دهند که Qwen-Image 3.0 می‌تواند در کنار تولید تصویر، از اطلاعات به‌روز نیز برای ساخت برخی خروجی‌ها استفاده کند.

علی‌بابا تنها چند ماه پس از معرفی Qwen-Image 2.0 در ماه مه، نسل سوم این مدل را رونمایی کرده است و گزارش فنی نسخه قبلی عمدتاً بر افزایش بهره‌وری فرایند آموزش و استنتاج تمرکز داشت و از نسخه‌ای سریع‌تر خبر می‌داد که برای تولید هر تصویر تنها به ۴ مرحله نیاز داشت؛ در حالی که نسخه استاندارد همان مدل این کار را در ۴۰ مرحله انجام می‌داد.

براساس نتایج منتشرشده از پلتفرم اختصاصی ارزیابی Alibaba، مدل Qwen-Image 2.0 در رتبه‌بندی داخلی این شرکت، پایین‌تر از GPT-Image 2 متعلق به OpenAI و Nano Banana Pro ساخت گوگل قرار گرفت. در حال حاضر نیز به نظر می‌رسد Qwen-Image 3.0 تنها از طریق API و با دسترسی مبتنی بر دعوت‌نامه در اختیار کاربران قرار گرفته و انتظار می‌رود به‌زودی وارد برنامه‌های رسمی مانند Qwen Chat شود.

با وجود پیشرفت قابل توجه این مدل در تولید متن، چیدمان‌های پیچیده و بازسازی رابط‌های کاربری، ارزش عملی برخی از نمونه‌های ارائه‌شده همچنان محل بحث است. پژوهشگران معمولاً مقالات علمی را با LaTeX می‌نویسند و صفحه‌آرایی می‌کنند، نه اینکه آن‌ها را به‌صورت تصویر تولید کنند. به همین دلیل، چنین خروجی‌هایی احتمالاً بیشتر برای ساخت ماکت‌ها و پیش‌نمایش‌های بصری مناسب خواهند بود تا نسخه نهایی اسناد. قالب‌های قابل جست‌وجو و قابل ویرایش نیز همچنان برای فرایندهای تولیدی انعطاف بیشتری ارائه می‌کنند، هرچند این نمونه‌ها نشان می‌دهند فناوری رندر متن در مدل‌های تصویری تا چه اندازه پیشرفت کرده است.

منبع

پوریا | ۴ ساعت پیش

دیدگاهتان را بنویسید