
مدل چندوجهی FLUX 3 معرفی شد؛ ترکیب تصویر، ویدئو، صدا و پیشبینی اقدام
شرکت FLUX از مدل پایه جدید خود با نام FLUX 3 رونمایی کرده است؛ مدلی چندوجهی که بهصورت همزمان روی تصاویر، ویدئوها و فایلهای صوتی آموزش دیده و برای درک، پیشبینی و انجام وظایف در محیطهای فیزیکی و دیجیتال توسعه یافته است. این مدل علاوه بر تولید تصویر و ویدئو همراه با صدای بومی، نخستین محصول FLUX بهشمار میرود که بهطور کامل بر یک معماری چندوجهی یکپارچه متکی است.
به گفته توسعهدهندگان، FLUX 3 بهجای آموزش جداگانه هر رسانه، تلاش میکند بازنمایی واحدی از جهان بسازد؛ بازنماییای که بتواند نحوه قرارگیری اشیا، حرکت آنها و ارتباط میان رویدادها و صداها را درک کند. از دید این شرکت، دستیابی به درکی واقعی از جهان مستلزم یادگیری همزمان تصویر، ویدئو، صدا و زبان و همچنین ارتباط میان آنها است، نه پردازش مستقل هر رسانه.
FLUX معتقد است هیچ رسانهای بهتنهایی نمیتواند تصویری کامل از واقعیت ارائه دهد، زیرا هرکدام تنها بخشی از اطلاعات جهان را ثبت میکنند. تصاویر روابط فضایی را نمایش میدهند، ویدئو بُعد زمان، حرکت و قوانین فیزیکی را آشکار میکند، صدا پیوند میان رخدادهای مکانیکی و پدیدههای آکوستیکی را نشان میدهد و زبان نیز این ادراکات را به اهداف، مفاهیم انتزاعی و دستورالعملها متصل میکند.

بر اساس توضیحات منتشرشده، یادگیری همزمان این رسانهها باعث میشود هرکدام نقش تأییدکننده دیگری را داشته باشند و برای نمونه، صدای تولیدشده باید با نحوه برخورد اجسام هماهنگ باشد، حرکت اشیا با جرم آنها سازگاری داشته باشد و رخدادهای آینده نیز از اتفاقات گذشته پیروی کنند. به باور FLUX، همین محدودیتهای مشترک، مدل را به درک عمیقتری از واقعیت زیربنایی میرساند.
FLUX 3 بر پایه فناوری Self-Flow توسعه یافته است؛ رویکردی که با هدف همراستا کردن قابلیتهای درک و تولید محتوای چندوجهی در یک معماری مشترک طراحی شده است. شرکت سازنده اعلام میکند پس از توسعه این فناوری، منابع پردازشی و حجم دادههای آموزشی را بهطور چشمگیری افزایش داده تا مدل بتواند بهصورت همزمان روی تصویر، ویدئو و صدا آموزش ببیند و هر دو وظیفه درک و تولید را در یک چارچوب واحد انجام دهد.
این معماری امکان ترکیب رسانههای مختلف را برای FLUX 3 فراهم کرده است؛ بنابراین مدل میتواند تصویر و ویدئوهای دارای صدای بومی تولید کند و تنها به دستورهای متنی نیز محدود نیست. کاربران قادر هستند تصاویر یا ویدئوهای مرجع را به مدل ارائه دهند تا خروجی بر همان اساس ساخته شود. FLUX این رویکرد را گامی در مسیر دستیابی به «هوش بصری دنیای واقعی» توصیف میکند که بر ادراک، پیشبینی و اقدام تمرکز دارد.
در بخش تولید ویدئو FLUX 3 میتواند در یک مرحله ویدئوهایی با حداکثر زمان ۲۰ ثانیه همراه با صدای بومی تولید کند. این مدل از تولید ویدئو از متن، تبدیل تصویر به ویدئو با ادامه یک فریم آغازین یا استفاده از تصاویر مرجع، تبدیل ویدئو به ویدئو با حفظ شخصیت یا عناصر اصلی، ادامه مولد ویدئو و صدا و همچنین تولید ویدئو از فریمهای کلیدی برای ایجاد گذارهای کنترلشده میان صحنهها پشتیبانی میکند.
علاوه بر این FLUX 3 از گفتوگوهای چندزبانه، طیف گستردهای از سبکهای بصری و نسبتهای تصویر، زنجیرهسازی عاملمحور چند کلیپ برای ساخت سکانسهای طولانیتر، تولید تایپوگرافی دقیق و طراحیهای متحرک نیز پشتیبانی میکند. به گفته شرکت سازنده این مدل قادر است خروجیهایی از ویدئوهای ساده با ظاهر دوربین خانگی تا انیمیشن و آثار سینمایی تولید کند. ارزیابیهای اولیه نیز با کلیپهای متنبهویدئوی ۱۰ ثانیهای با وضوح 720p و صدای همراه انجام شدهاند.

به گفته FLUX این مدل همچنان در مرحله توسعه قرار دارد و انتظار میرود طی دوره دسترسی زودهنگام عملکرد آن بهبود پیدا کند. با این حال نتایج مقایسههای انسانی نشان میدهد FLUX 3 در حداکثر ۶۹ درصد مقایسهها نسبت به Grok Imagine Video، در ۶۰ درصد نسبت به Kling v3 Pro، در ۵۹ درصد نسبت به Happy Horse v1، در ۵۷ درصد نسبت به Happy Horse 1.1 و در ۵۲ درصد نسبت به Seedance 2.0 و Gemini Omni Flash ترجیح داده شده است. همچنین این مدل در ۷۷ درصد مقایسهها عملکرد بهتری از Runway Gen-4.5 و در ۹۳ درصد موارد نتیجه مطلوبتری نسبت به Luma Ray 3.2 ارائه کرده است.
شرکت سازنده میگوید FLUX 3 Video در نمایش حالتهای چهره انسان، هماهنگسازی صدا با رویدادهای فیزیکی و پشتیبانی از گفتوگوهای چندزبانه عملکرد قابلتوجهی دارد. همچنین میتوان با ترکیب قابلیتهای آن، سکانسهایی چنددقیقهای ساخت تا شخصیتها با استفاده از تصاویر مرجع، ظاهر و هویت یکسان خود را در تمام صحنهها حفظ کنند. نسخه FLUX 3 Video هماکنون از طریق برنامه Early Access در دسترس قرار گرفته است.
در بخش تصویر سازی نیز FLUX 3 امکان تولید و ویرایش تصاویر را در سبکها، نسبتهای تصویر و وضوحهای مختلف فراهم میکند. ارزیابیهای اولیه که در میانه فرایند آموزش انجام شدهاند، نشان میدهند این مدل نسبت به نسخههای پیشین FLUX در پردازش دستورهای پیچیده و تولید متن پیشرفت محسوسی داشته و میتواند متن را با دقت بالا به زبانهای مختلف رندر کند. با این حال شرکت سازنده تأکید میکند این نتایج هنوز نهایی نیستند و مرحله دسترسی زودهنگام FLUX 3 Image طی هفتههای آینده آغاز خواهد شد.
تواناییهای FLUX 3 به تولید محتوا محدود نمیشود و بخش اقدام نیز یکی از مهمترین اجزای این پروژه است. توسعهدهندگان برای تحقق این هدف دو مسیر را دنبال کردهاند؛ نخست، افزودن قابلیت پیشبینی اقدام بهصورت بومی در FLUX 3 از طریق گسترش فناوری Self-Flow و دوم، استفاده از ستون فقرات ویدئویی از پیش آموزشدیده بهعنوان پایهای آگاه از پویایی که امکان توسعه مدلهای تخصصی اقدام را با دادههای محدود فراهم میکند.
FLUX اعلام کرده عرضه این خانواده از مدلها بهصورت مرحلهای و پس از دریافت بازخورد کاربران و انجام آزمونهای ایمنی انجام خواهد شد. بر این اساس FLUX 3 Video برای تولید و ویرایش ویدئو و صدا از طریق API و دسترسی خصوصی به وزنهای مدل، FLUX 3 Action و FLUX-mimic برای پیشبینی اقدام از مسیر شرکای پژوهشی و تجاری، FLUX 3 Image برای تولید و ویرایش تصویر و FLUX 3 Dev بهعنوان نسخه متنباز وزنهای ستون فقرات چندوجهی منتشر خواهند شد.




