جینگدونگ (JD.com) از منبع باز کردن مدل ویرایش ویدیوی بیدرنگ خود به نام JoyAI-Video-Edit خبر داد. این مدل که توسط خود شرکت توسعه یافته، به کاربران امکان میدهد تا در حین تماشای ویدیوها، شخصیتها و صحنهها را تغییر دهند. این قابلیت، فرآیند خلق ویدیو را از «ویرایش پس از جمعآوری مواد» به ویرایش تعاملی و بیدرنگ تبدیل میکند. مقامات جینگدونگ اعلام کردهاند که این مدل در ویرایش ویدیوی بیدرنگ، عملکردی فراتر از مدلهای نماینده فعلی صنعت دارد و به استانداردهای جهانی رسیده است.

ویرایش ویدیوی بیدرنگ ابتدا باید مشکل سرعت را حل کند. ویدیوها از فریمهای پیوسته تشکیل شدهاند و اگر سرعت پردازش مدل نتواند با سرعت پخش هماهنگ شود، تأخیر و لگ ایجاد خواهد شد. JoyAI-Video-Edit بر پایه مدل کاملاً توسعهیافته JoyAI-Video ساخته شده و به سرعت استنتاج ۳۰ فریم در ثانیه با رزولوشن 720P دست یافته است. این مدل میتواند ضمن حفظ وضوح بالای تصویر، با ریتم پخش فیلمها و ویدیوهای رایج هماهنگ باشد.
طول ویدیو نیز مانعی برای ویرایش جریانی (streaming) است. پیش از این، مدلهای ویرایش جریانی تنها میتوانستند بخشهایی در حد چند ثانیه یا دقیقه را مدیریت کنند، اما JoyAI-Video-Edit از ویرایش جریانی پایدار با هر مدت زمانی پشتیبانی میکند و امکان پردازش پیوسته را همزمان با پخش ویدیو فراهم میآورد. کاربران نیازی ندارند منتظر بمانند تا کل ویدیو تولید شود؛ آنها میتوانند در لحظه تغییراتی در صحنهها ایجاد کنند، اشیاء را جایگزین کنند، ظاهر شخصیتها را تنظیم کنند یا سبک بصری را تغییر دهند و به این ترتیب «در حین تماشا، خلق کنند».
ارزیابی جامع و معتبر، مزایای برجسته در چهار نوع وظیفه ویرایش
برای ارزیابی قابلیتهای این مدل، تیم تحقیقاتی JoyAI-Video-Edit را با مدلهای ویرایش ویدیوی جریانی نماینده بینالمللی مانند SANA Streaming، LiveEdit و Xmax-X2.0 مقایسه کرد. نتایج نشان داد که JoyAI-Video-Edit در دادههای ارزیابی که سناریوهای معمول ویرایش ویدیو را پوشش میدهند، عملکردی جامعاً برتر از سایرین داشت.
در ارزیابی عمومی و معتبر OpenVE-Bench در صنعت، این مدل از تمامی روشهای ویرایش جریانی فعلی پیشی گرفت و به ویژه در وظایف ویرایش سبک کلی، جایگزینی محلی، حذف محلی و ویرایش زیرنویس برتری چشمگیری نسبت به همتایان صنعتی خود نشان داد. در سناریوهای کاربردی خاص، سازندگان میتوانند شخصیتها را در ویدیو به طور مداوم لباس عوض کنند، خیابانهای عادی را در طول پخش زنده به دنیاهای انیمیشنی تبدیل کنند، یا مبلمان، رنگ دیوارها و جلوههای نوری مختلف را در طراحی داخلی منزل امتحان کنند.
نه فقط خلق ویدیو، بلکه تولید دادههای آموزشی برای رباتها
قابل ذکر است که JoyAI-Video-Edit یک مسیر فنی جدید برای سنتز در مقیاس بزرگ دادههای هوش تجسمیافته (embodied intelligence) نیز فراهم میکند. آموزش رباتها به حجم زیادی از ویدیوها در مورد گرفتن، جابجایی و عملیات اشیاء نیاز دارد، اما جمعآوری دادههای واقعی ماشین پرهزینه است و سناریوهای خطرناک یا نادر را نمیتوان به طور مکرر جمعآوری کرد.
با قابلیتهای ویرایش قابل کنترل بر صحنهها، اشیاء و محتوای بصری، JoyAI-Video-Edit میتواند ویدیوهای عملیات دستی را به مواد عملیاتی دست یا بازوی مکانیکی تبدیل کند. این مدل میتواند موقعیت اشیاء، روابط فضایی و مسیرهای حرکت را حفظ کند، در حالی که صحنهها، اشیاء و اشکال ربات را جایگزین میکند و یک ویدیوی واحد را به نمونههای آموزشی بیشتری گسترش میدهد. از خلق ویدیو گرفته تا سنتز دادههای آموزشی ربات، منبع باز کردن این مدل ممکن است افقهای جدیدی را در چندین حوزه باز کند.
