CoreTech

مدل چندوجهی FLUX 3 معرفی شد؛ ترکیب تصویر، ویدئو، صدا و پیش‌بینی اقدام

ابوالفضل | ۸ ساعت پیش

شرکت FLUX از مدل پایه جدید خود با نام FLUX 3 رونمایی کرده است؛ مدلی چندوجهی که به‌صورت هم‌زمان روی تصاویر، ویدئوها و فایل‌های صوتی آموزش دیده و برای درک، پیش‌بینی و انجام وظایف در محیط‌های فیزیکی و دیجیتال توسعه یافته است. این مدل علاوه بر تولید تصویر و ویدئو همراه با صدای بومی، نخستین محصول FLUX به‌شمار می‌رود که به‌طور کامل بر یک معماری چندوجهی یکپارچه متکی است.

به گفته توسعه‌دهندگان، FLUX 3 به‌جای آموزش جداگانه هر رسانه، تلاش می‌کند بازنمایی واحدی از جهان بسازد؛ بازنمایی‌ای که بتواند نحوه قرارگیری اشیا، حرکت آن‌ها و ارتباط میان رویدادها و صداها را درک کند. از دید این شرکت، دستیابی به درکی واقعی از جهان مستلزم یادگیری هم‌زمان تصویر، ویدئو، صدا و زبان و همچنین ارتباط میان آن‌ها است، نه پردازش مستقل هر رسانه.

FLUX معتقد است هیچ رسانه‌ای به‌تنهایی نمی‌تواند تصویری کامل از واقعیت ارائه دهد، زیرا هرکدام تنها بخشی از اطلاعات جهان را ثبت می‌کنند. تصاویر روابط فضایی را نمایش می‌دهند، ویدئو بُعد زمان، حرکت و قوانین فیزیکی را آشکار می‌کند، صدا پیوند میان رخدادهای مکانیکی و پدیده‌های آکوستیکی را نشان می‌دهد و زبان نیز این ادراکات را به اهداف، مفاهیم انتزاعی و دستورالعمل‌ها متصل می‌کند.

بر اساس توضیحات منتشرشده، یادگیری هم‌زمان این رسانه‌ها باعث می‌شود هرکدام نقش تأییدکننده دیگری را داشته باشند و برای نمونه، صدای تولیدشده باید با نحوه برخورد اجسام هماهنگ باشد، حرکت اشیا با جرم آن‌ها سازگاری داشته باشد و رخدادهای آینده نیز از اتفاقات گذشته پیروی کنند. به باور FLUX، همین محدودیت‌های مشترک، مدل را به درک عمیق‌تری از واقعیت زیربنایی می‌رساند.

FLUX 3 بر پایه فناوری Self-Flow توسعه یافته است؛ رویکردی که با هدف هم‌راستا کردن قابلیت‌های درک و تولید محتوای چندوجهی در یک معماری مشترک طراحی شده است. شرکت سازنده اعلام می‌کند پس از توسعه این فناوری، منابع پردازشی و حجم داده‌های آموزشی را به‌طور چشمگیری افزایش داده تا مدل بتواند به‌صورت هم‌زمان روی تصویر، ویدئو و صدا آموزش ببیند و هر دو وظیفه درک و تولید را در یک چارچوب واحد انجام دهد.

این معماری امکان ترکیب رسانه‌های مختلف را برای FLUX 3 فراهم کرده است؛ بنابراین مدل می‌تواند تصویر و ویدئوهای دارای صدای بومی تولید کند و تنها به دستورهای متنی نیز محدود نیست. کاربران قادر هستند تصاویر یا ویدئوهای مرجع را به مدل ارائه دهند تا خروجی بر همان اساس ساخته شود. FLUX این رویکرد را گامی در مسیر دستیابی به «هوش بصری دنیای واقعی» توصیف می‌کند که بر ادراک، پیش‌بینی و اقدام تمرکز دارد.

در بخش تولید ویدئو FLUX 3 می‌تواند در یک مرحله ویدئوهایی با حداکثر زمان ۲۰ ثانیه همراه با صدای بومی تولید کند. این مدل از تولید ویدئو از متن، تبدیل تصویر به ویدئو با ادامه یک فریم آغازین یا استفاده از تصاویر مرجع، تبدیل ویدئو به ویدئو با حفظ شخصیت یا عناصر اصلی، ادامه مولد ویدئو و صدا و همچنین تولید ویدئو از فریم‌های کلیدی برای ایجاد گذارهای کنترل‌شده میان صحنه‌ها پشتیبانی می‌کند.

علاوه بر این FLUX 3 از گفت‌وگوهای چندزبانه، طیف گسترده‌ای از سبک‌های بصری و نسبت‌های تصویر، زنجیره‌سازی عامل‌محور چند کلیپ برای ساخت سکانس‌های طولانی‌تر، تولید تایپوگرافی دقیق و طراحی‌های متحرک نیز پشتیبانی می‌کند. به گفته شرکت سازنده این مدل قادر است خروجی‌هایی از ویدئوهای ساده با ظاهر دوربین خانگی تا انیمیشن و آثار سینمایی تولید کند. ارزیابی‌های اولیه نیز با کلیپ‌های متن‌به‌ویدئوی ۱۰ ثانیه‌ای با وضوح 720p و صدای همراه انجام شده‌اند.

به گفته FLUX این مدل همچنان در مرحله توسعه قرار دارد و انتظار می‌رود طی دوره دسترسی زودهنگام عملکرد آن بهبود پیدا کند. با این حال نتایج مقایسه‌های انسانی نشان می‌دهد FLUX 3 در حداکثر ۶۹ درصد مقایسه‌ها نسبت به Grok Imagine Video، در ۶۰ درصد نسبت به Kling v3 Pro، در ۵۹ درصد نسبت به Happy Horse v1، در ۵۷ درصد نسبت به Happy Horse 1.1 و در ۵۲ درصد نسبت به Seedance 2.0 و Gemini Omni Flash ترجیح داده شده است. همچنین این مدل در ۷۷ درصد مقایسه‌ها عملکرد بهتری از Runway Gen-4.5 و در ۹۳ درصد موارد نتیجه مطلوب‌تری نسبت به Luma Ray 3.2 ارائه کرده است.

شرکت سازنده می‌گوید FLUX 3 Video در نمایش حالت‌های چهره انسان، هماهنگ‌سازی صدا با رویدادهای فیزیکی و پشتیبانی از گفت‌وگوهای چندزبانه عملکرد قابل‌توجهی دارد. همچنین می‌توان با ترکیب قابلیت‌های آن، سکانس‌هایی چنددقیقه‌ای ساخت تا شخصیت‌ها با استفاده از تصاویر مرجع، ظاهر و هویت یکسان خود را در تمام صحنه‌ها حفظ کنند. نسخه FLUX 3 Video هم‌اکنون از طریق برنامه Early Access در دسترس قرار گرفته است.

در بخش تصویر سازی نیز FLUX 3 امکان تولید و ویرایش تصاویر را در سبک‌ها، نسبت‌های تصویر و وضوح‌های مختلف فراهم می‌کند. ارزیابی‌های اولیه که در میانه فرایند آموزش انجام شده‌اند، نشان می‌دهند این مدل نسبت به نسخه‌های پیشین FLUX در پردازش دستورهای پیچیده و تولید متن پیشرفت محسوسی داشته و می‌تواند متن را با دقت بالا به زبان‌های مختلف رندر کند. با این حال شرکت سازنده تأکید می‌کند این نتایج هنوز نهایی نیستند و مرحله دسترسی زودهنگام FLUX 3 Image طی هفته‌های آینده آغاز خواهد شد.

توانایی‌های FLUX 3 به تولید محتوا محدود نمی‌شود و بخش اقدام نیز یکی از مهم‌ترین اجزای این پروژه است. توسعه‌دهندگان برای تحقق این هدف دو مسیر را دنبال کرده‌اند؛ نخست، افزودن قابلیت پیش‌بینی اقدام به‌صورت بومی در FLUX 3 از طریق گسترش فناوری Self-Flow و دوم، استفاده از ستون فقرات ویدئویی از پیش آموزش‌دیده به‌عنوان پایه‌ای آگاه از پویایی که امکان توسعه مدل‌های تخصصی اقدام را با داده‌های محدود فراهم می‌کند.

FLUX اعلام کرده عرضه این خانواده از مدل‌ها به‌صورت مرحله‌ای و پس از دریافت بازخورد کاربران و انجام آزمون‌های ایمنی انجام خواهد شد. بر این اساس FLUX 3 Video برای تولید و ویرایش ویدئو و صدا از طریق API و دسترسی خصوصی به وزن‌های مدل، FLUX 3 Action و FLUX-mimic برای پیش‌بینی اقدام از مسیر شرکای پژوهشی و تجاری، FLUX 3 Image برای تولید و ویرایش تصویر و FLUX 3 Dev به‌عنوان نسخه متن‌باز وزن‌های ستون فقرات چندوجهی منتشر خواهند شد.

ابوالفضل | ۸ ساعت پیش

دیدگاهتان را بنویسید