شرکت هوش مصنوعی مینیمکس، پس از سرمایهگذاری مستمر در فناوری مدلهای زبان بزرگ، اخیراً به طور رسمی مدل تولید چندوجهی جدید خود، MiniMax H3، را عرضه کرده و متعهد شده است که وزنهای این مدل را ظرف چند روز آینده به طور کامل متنباز کند.
به عنوان یک مدل تولیدی که از ورودیهای متنی چندوجهی پشتیبانی میکند، MiniMax H3 میتواند هر ترکیبی از متن، تصاویر، ویدئوها و صدا را به عنوان ورودی دریافت کرده و در نهایت ویدئوهای با کیفیت بالا همراه با صدای استریو بومی تولید کند. در کاربردهای عملی، کاربران تنها کافی است ویدئوهای مرجع، تصاویر یا مواد صوتی را به همراه دستورالعملهای زبان طبیعی به مدل ارائه دهند تا به راحتی و بدون مشکل، تولید محتوای صوتی و تصویری پیچیده را تکمیل کنند.

در بخش معماری فنی، MiniMax H3 به طور کامل از رویکرد سنتی تقسیم مدلهای تخصصی بر اساس وظیفه در مدلهای چندوجهی فاصله گرفته است. تیم توسعه وظایف مختلفی مانند تبدیل متن به تصویر، متن به ویدئو، تصویر به ویدئو و پردازش صدا را در یک چارچوب پیشآموزشی واحد ادغام کرده و یک معماری ترانسفورمر H3-Omni فشردهتر را معرفی کرده است که توان عملیاتی آموزش سرتاسری را تقریباً ۳۰ درصد افزایش داده است. در عین حال، از طریق معماری H3-VAE که با بازنویسی توکنایزر به دست آمده، به نرخهای فشردهسازی بسیار بالایی دست یافته و به طور مؤثری هزینههای استنتاج را در رزولوشنهای بالا کاهش داده است.
در مورد قیمتگذاری و اکوسیستم، MiniMax H3 در رزولوشن 2K، در هر ثانیه کمتر از یک سوم مدلهای مشابه رایج هزینه دارد و در مرحله طراحی، سازگاری کامل با تراشههای داخلی در نظر گرفته شده است. در حال حاضر، این مدل پتانسیل کاربردی گستردهای در سناریوهایی مانند تیتراژ فیلمها، انیمیشنهای رابط کاربری بازی، پوسترهای متحرک و تبلیغات تجارت الکترونیک نشان میدهد. دقت آن در رندر متن و ارائه اطلاعات برند نیز به طور قابل توجهی بهبود یافته است.
