FLUX3 رونمایی شد: ویدیوی ۲۰ ثانیهای با صدای همزمان
FLUX 3 مدل چندوجهی است که ویدیو، صدا و تصویر را با یک معماری میسازد. هدفش چیست و نسخه اوپنسورس FLUX 3 Dev کی میآید؟

FLUX 3 چیست، چه هدفی دارد و نسخه اوپنسورسش کی میآید؟
بلکفارست لبز (BFL) روز ۲۳ جولای 2026 از FLUX 3 رونمایی کرد. این مدل برخلاف نسلهای قبلی خانواده فلاکس، فقط مدل تصویر نیست و یک مدل پایه چندوجهی (multimodal) است که تصویر، ویدیو، صدا و پیشبینی حرکت را با یک معماری واحد تولید میکند. فعلاً هم در دسترس عموم نیست و از طریق یک برنامه دسترسی زودهنگام (Early Access) با تأیید شرکت ارائه میشود.
FLUX 3 دقیقاً چه فرقی با نسل قبل دارد
بیشتر سرویسهایی که امروز هم ویدیو میسازند و هم تصویر، در واقع چند مدل جداگانهاند که پشت یک رابط کاربری مشترک کنار هم چیده شدهاند. ادعای بلکفارست لبز درباره FLUX 3 این است که چنین چیزی نیست و مدل بهصورت همزمان روی تصویر، ویدیو و صدا آموزش دیده است.
استدلال شرکت هم قابل فهم است. هر کدام از این سه، تصویری ناقص از یک واقعیت واحد میدهند. عکس، ساختار مکانی صحنه را در یک لحظه ثبت میکند. ویدیو بعد زمان را برمیگرداند و نشان میدهد اشیا چطور حرکت میکنند. صدا رابطه علت و معلولی بین برخورد فیزیکی و آنچه شنیده میشود را آشکار میکند، چیزی که از روی تصویر تنها قابل تشخیص نیست. وقتی مدل هر سه را با هم یاد بگیرد، اینها همدیگر را محدود میکنند، یعنی صدا باید با ضربه بخواند و حرکت باید با جرم جسم جور دربیاید. نتیجه عملیاش برای کاربر این است که ویدیو و صدا در یک مرحله و هماهنگ با هم ساخته میشوند، نه اینکه صدا بعداً روی تصویر سوار شود.
پایه فنی این کار روشی است که خود شرکت اسمش را Self-Flow گذاشته و پیشتر دربارهاش مقاله منتشر کرده بود. بلکفارست لبز میگوید همان روش را با حجم بسیار بیشتری از داده و محاسبات مقیاس داده و FLUX 3 را با آن آموزش داده است.
هدفش فقط ساخت ویدیو نیست
شرکت هدف بلندمدت خود را هوش بصری (visual intelligence) توصیف میکند، یعنی مدلهایی که در محیط فیزیکی و دیجیتال ادراک میکنند، آینده را پیشبینی میکنند و عمل انجام میدهند. FLUX 3 را هم نه محصول نهایی، بلکه یک ایستگاه میانی در همین مسیر معرفی میکند.
بخش سوم مدل، یعنی پیشبینی حرکت (action prediction)، همینجا معنا پیدا میکند. مدلی که یاد گرفته باشد اجسام در ویدیو چطور حرکت میکنند، عملاً چیزی درباره فیزیک جهان میداند و میشود از همان دانش برای فرماندادن به یک ربات استفاده کرد. بلکفارست لبز این کار را با شرکت رباتیک mimic انجام داده و مدلی به نام FLUX-mimic ساخته است. به گفته شرکت، این مدل هماکنون در خطوط تولید آئودی روی کارهایی مثل جابهجایی اجسام نرم و شکلپذیر آزمایش میشود؛ کاری که رباتیک متعارف بهسختی و با هزینه بالا از پسش برمیآید.
هدف نسل بعدی را هم صریح اعلام کردهاند و آن یکیکردن ادراک، عمل و زبان در یک مدل واحد است.
چه کارهایی از FLUX 3 برمیآید
بخش ویدیو، که تنها بخش در دسترس فعلی است، میتواند در یک بار تولید تا ۲۰ ثانیه ویدیوی همراه با صدا بسازد. این عدد از سقف حدوداً ۱۰ ثانیهای بیشتر مدلهای رقیب بالاتر است. ورودیاش میتواند متن، تصویر یا ویدیو باشد و این قابلیتها را پوشش میدهد:
- ساخت ویدیو از متن، و ساخت ویدیو از یک تصویر شروع یا تصویرهای مرجع
- ادامهدادن یک ویدیو و صدای موجود
- ساخت ویدیو بین دو کیفریم مشخص برای کنترل نقطه شروع و پایان حرکت
- دیالوگ چندزبانه با صدای تولیدشده توسط خود مدل
- زنجیرهکردن چند کلیپ پشت سر هم برای ساخت سکانسهای چندنمایی و چنددقیقهای
بخش تصویر هنوز منتشر نشده و شرکت گفته چند هفته بعد وارد دسترسی زودهنگام میشود. ادعای اصلی دربارهاش، بهبود محسوس در اجرای پرامپتهای پیچیده و نوشتن متن دقیق و چندزبانه داخل تصویر است.
یک محدودیت را هم باید بدانید. رزولوشن در شروع دسترسی زودهنگام روی 720p بسته شده و 1080p قرار است بعداً بیاید. قیمت هیچکدام از سطوح هم هنوز اعلام نشده است.
اعدادی که منتشر شده را با احتیاط بخوانید
بلکفارست لبز نتایج یک ارزیابی ترجیحی را منتشر کرده است. در این نوع ارزیابی، خروجی دو مدل کنار هم گذاشته میشود و از داور انسانی میپرسند کدام را ترجیح میدهد، پس عدد نهایی درصد دفعاتی است که خروجی این مدل انتخاب شده، نه نمره کیفیت مطلق.
بر اساس این ارزیابی، FLUX 3 در ۹۳ درصد مقایسهها بر Luma Ray 3.2 و در ۷۷ درصد بر Runway Gen-4.5 ترجیح داده شده است. فاصلهاش با بقیه کمتر است و در برابر Kling v3 Pro به ۶۰ درصد و در برابر Seedance 2.0 و Gemini Omni Flash به ۵۲ درصد میرسد، که عملاً یعنی تفاوت معناداری وجود ندارد.
دو نکته را در نظر بگیرید. اول اینکه این آزمون را خود سازنده اجرا کرده و روی کلیپهای ۱۰ ثانیهای 720p انجام شده، پس نتیجهاش برای ویدیوی ۲۰ ثانیهای لزوماً همان نیست. دوم اینکه خود شرکت هم نوشته این نتایج مقدماتی است و مربوط به نسخهای در حال توسعه. ارزیابی مستقل هنوز منتشر نشده است.
آیا FLUX 3 اوپنسورس میشود؟
پاسخ کوتاه این است که نسخهای با وزنهای باز قطعاً در برنامه هست، اما هنوز منتشر نشده و «وزن باز» با «اوپنسورس» یکی نیست.
بلکفارست لبز در برنامه انتشار خود چهار مورد را فهرست کرده است و مورد چهارم صراحتاً «دسترسی open-weight به بکبون چندوجهی» با نام FLUX 3 Dev است. بکبون یعنی همان مدل پایهای که هر چهار قابلیت روی آن سوارند. سه مورد دیگر عبارتاند از ویدیو و صدا، پیشبینی حرکت، و تصویر که همگی از راه API یا وزنهای خصوصی ارائه میشوند.
مسئله اینجاست که درباره نسخه اوپنسورس FLUX 3 Dev هیچ جزئیاتی اعلام نشده است. تاریخ انتشار مشخصی وجود ندارد و تنها زمانبندی اعلامشده «اواخر امسال میلادی» است. لایسنس، تعداد پارامترها، نیازمندی سختافزاری و مخزن هاگینگفیس هم هنوز اعلام نشدهاند.
تفاوت وزن باز و اوپنسورس هم اینجا اهمیت دارد. وزن باز یعنی فایل مدل را دانلود میکنید و روی سختافزار خودتان اجرا میکنید، اما شرایط استفاده را لایسنس تعیین میکند. سابقه خود شرکت دو الگوی متفاوت دارد. FLUX.1 [schnell] با لایسنس Apache 2.0 منتشر شد که واقعاً اوپنسورس محسوب میشود و استفاده تجاریاش آزاد است، اما نسخههای [dev] با لایسنس غیرتجاری آمدند که استفاده تجاری مستقیم را نمیدهد. بلکفارست لبز نگفته FLUX 3 Dev کدام مسیر را میرود.
یک نکته دیگر هم هست که ارزش توجه دارد. در خانواده FLUX.1، انتشار وزنها تقریباً همزمان با معرفی مدل بود و همان چیزی بود که اکوسیستم فاینتیون و LoRA و ComfyUI را دور فلاکس ساخت. این بار ترتیب برعکس شده و دسترسی API و شرکای منتخب اول آمدهاند و وزن باز آخر میآید. برای کسی که میخواهد مدل را محلی اجرا کند، این یعنی انتظار طولانیتر.
اگر میخواهید همین حالا امتحانش کنید
- از صفحه مدل در سایت بلکفارست لبز درخواست دسترسی بدهید. [صفحه FLUX 3] فرم درخواست دارد و پذیرش با تأیید شرکت است، نه فوری. شرکت زمان انتظار مشخصی اعلام نکرده است.
۲. یا سراغ پلتفرمهای شریک بروید. بخشی از سرویسهای شریک مثل Krea از ابتدای اوت 2026 نسخه ویدیویی FLUX 3 را در دسترس کاربران خود گذاشتهاند، که مسیر سریعتری از انتظار برای دسترسی مستقیم است.
۳. انتظار اجرای محلی نداشته باشید.تا زمانی که FLUX 3 Dev منتشر نشود، هیچ نسخهای برای اجرا روی سیستم خودتان وجود ندارد و پشتیبانی رسمی ComfyUI هم در دسترس نیست.
اگر دارید برای یک محصول یا گردش کار تولیدی برنامهریزی میکنید، مهمترین چیزی که باید از این خبر بردارید همین است: قابلیتهای اعلامشده واقعیاند و بخشی از آنها همین حالا در کارخانه آئودی در حال آزمایش است، اما آنچه امروز عملاً به دست شما میرسد یک دسترسی محدود و بدون قیمت اعلامشده است. برنامهتان را روی فرض انتشار زودهنگام وزنهای باز نبندید.




گفتگو و سوالات شما
۰در این قسمت میتوانید سوال یا نظر خود در مورد مقاله را مطرح کنید.
برای ثبت دیدگاه ابتدا وارد شوید
ورود به حسابهنوز دیدگاهی ثبت نشده. اولین نفر باشید!