xAI یک ارتقاء بزرگ برای مدل تولید ویدئوی خود، Imagine Video 1.5، ارائه کرده است که قابلیتهای ارجاع تصویر، ارجاع صدا، تولید ویدئو از متن و خروجی بومی 1080p را به آن اضافه میکند. این قابلیتها ثبات نقشها، کنترل صحنه و کیفیت ویدئو را در ساخت ویدئو با هوش مصنوعی بیشتر بهبود میبخشند. در حال حاضر، قابلیتهای تولید ویدئو از متن و تولید ویدئوی 1080p در نسخه وب Grok Imagine و اپلیکیشنهای iOS و Android در دسترس هستند. قابلیتهای ارجاع تصویر و صدا در ابتدا برای کاربران SuperGrok Heavy و SuperGrok Plus در ایالات متحده فعال شدهاند و برنامههایی برای گسترش به کاربران بیشتر در آینده وجود دارد.

این بهروزرسانی فرآیند تولید ویدئو را برای کاربران انعطافپذیرتر میکند. سازندگان میتوانند مستقیماً از طریق توضیحات متنی ویدئو تولید کنند، یا تصاویر مرجع را برای کنترل شخصیتها، محصولات یا صحنهها آپلود کنند. آنها همچنین میتوانند تصاویر شخصیتها را با نمونههای صوتی ترکیب کنند تا هوش مصنوعی ظاهر و صدای ثابتی را در نماهای مختلف حفظ کند. xAI اعلام کرد که Imagine Video 1.5 تا هفت مرجع بصری را در هر تولید پشتیبانی میکند که برای تثبیت ویژگیهای چهره شخصیتها، ویژگیهای محصول یا عناصر محیطی استفاده میشود و به این ترتیب کنترل دقیقتری بر محتوا به دست میآید.
در حالت چند مرجعی، کاربران میتوانند هویت شخصیت را حفظ کرده و پسزمینه را تغییر دهند، صحنه را بدون تغییر نگه داشته و شخصیت را عوض کنند، یا فقط حرکت را تنظیم کرده و تنظیمات بصری کلی را حفظ کنند. قابلیت ارجاع صدا نیز مشکل تداوم شخصیت در تولید ویدئو با هوش مصنوعی را برطرف میکند و ویژگیهای چهره و عملکرد صوتی ثابتی را برای یک شخصیت در بخشهای مختلف تضمین میکند.
برای توسعهدهندگان، API شرکت xAI اکنون از فراخوانی قابلیتهای ارجاع تصویر، تولید ویدئو از متن و تولید ویدئوی بومی 1080p از طریق مدل grok-imagine-video-1.5 پشتیبانی میکند. توسعهدهندگان میتوانند با ارسال پارامترهایی مانند پرامپتها، URL تصاویر مرجع، مدت زمان ویدئو، نسبت ابعاد و رزولوشن از طریق API، ویدئو تولید کنند. قابلیت ارجاع صدا نیاز به ادغام از طریق متدهای درخواست دارد.
Imagine Video 1.5 ماه گذشته منتشر شد و xAI اعلام کرد که این نسخه عملکرد حرکت، شبیهسازی فیزیکی و تولید صدا را بهینه کرده است. این ارتقاء کنترل مدل بر هویت، صحنهها و جزئیات محصول را بیشتر میکند و تولید ویدئو با هوش مصنوعی را به تدریج از انتقال ساده تصاویر به یک ابزار خلاقیت چندوجهی نزدیکتر به فرآیندهای تولید فیلم حرفهای تبدیل میکند.
