آزمایشگاه Black Forest از راهاندازی مدل بنیادی چندوجهی FLUX3 در حالت دسترسی اولیه خبر داد. این مدل از یک معماری یکپارچه برای یادگیری مشترک تصاویر، ویدئوها و صدا استفاده میکند. بر اساس چارچوب یادگیری Self-Flow (تطبیق جریان خودنظارتی)، FLUX3 ویدئوها، تصاویر و صدا را به صورت همزمان آموزش میدهد و قابلیتهای سریهای FLUX.1 و FLUX.2 را به وظایف تولید و درک چندوجهی گسترش میدهد.
عملکرد کاملاً برتر، خروجی بومی با همگامسازی صدا
FLUX3 میتواند ویدئوهایی تا ۲۰ ثانیه را در یک بار تولید، همراه با صدای بومی، خروجی دهد. این مدل از حالتهای مختلف ایجاد محتوا مانند تبدیل متن به ویدئو، تصویر به ویدئو، ویدئو به ویدئو، ادامه ویدئو و صدای ورودی، تبدیل فریم کلیدی به ویدئو، گفتگوی چندزبانه و اتصال ویدئوهای چندشات پشتیبانی میکند. در ارزیابی دستی ویدئوهای ۱۰ ثانیهای 720p با صدا، FLUX3 در برابر Grok Imagine Video به نرخ برد ۶۹٪ و در برابر Seedance 2.0 و Gemini Omni Flash به نرخ برد ۵۲٪ دست یافت که نشاندهنده برتری جامع آن است.
