در ۱۱ می، هوش مصنوعی مینگشی (Mingshi Intelligence) با همکاری دانشگاه چینهوا (Tsinghua University) و جامعه متنباز OpenBMB، رسماً مدل بزرگ چندوجهی لبهای جدید MiniCPM-V4.6 را معرفی کرد. این مدل «سبکوزن» با تنها ۱.۳ میلیارد پارامتر، از طریق چگالی هوشمند فوقالعاده و سازگاری بین پلتفرمی خود، با موفقیت سقف عملکرد مدلهای بزرگتر را به چالش کشیده و کاربرد عملی هوش مصنوعی لبهای را تسریع بخشیده است.
۱. اوج عملکرد: «عملکرد برجسته» با ۱.۳ میلیارد پارامتر
MiniCPM-V4.6 دو نسخه Instruct و Thinking را معرفی کرده است که در ارزیابیهای مختلف در مقایسه با مدلهای هماندازه، قابلیتهای استدلال و درک قابل توجهی را نشان میدهند:
- پیشتازی جهانی: در لیست Artificial Analysis (AA)، مدل MiniCPM-V4.6 امتیاز عالی ۱۳ را کسب کرد. این مدل نه تنها به طور قابل توجهی از رقبای هماندازه (مانند Qwen3.5-0.8B از علیبابا و Gemma4-E2B-it از گوگل) پیشی گرفت، بلکه به عملکرد مدلهای با پارامترهای بزرگتر مانند Qwen3.5-2B نیز نزدیک شد و به یک معیار عملکرد در میان مدلهای سطح ۱ میلیارد پارامتر تبدیل گشت.
- قابلیتهای پیشرفته: چه در درک عمومی تصویر-متن، استدلال پیچیده ریاضی STEM، یا OCR اسناد چالشبرانگیز و درک زمانی ویدئو، این مدل سطح بالایی از هوش را به نمایش میگذارد. به ویژه در استدلال چند تصویری و سرکوب توهم، نسخه Thinking عملکرد فوقالعادهای دارد.
۲. انقلاب کارایی: «چگالی هوشمند» فوقالعاده در لبه
برای رفع «نگرانی حافظه» در استقرار لبهای، MiniCPM-V4.6 بهینهسازی عمیقی در سرعت استنتاج و مصرف منابع داشته است:
- آستانه سریع: نیاز به حافظه به ۶ گیگابایت کاهش یافته است که به گوشیهای هوشمند، رایانههای شخصی و دستگاههای خانه هوشمند رایج اجازه میدهد به راحتی اجرا شوند.
- کارایی استنتاج: بر اساس vLLM، توان عملیاتی استنتاج به ۱.۵ برابر رقبا میرسد؛ هنگام پردازش یک تصویر بزرگ فوقالعاده با کیفیت ۳۱۳۶² در لبه، تأخیر اولین پاسخ تنها ۷۵.۷ میلیثانیه است که ۲.۲ برابر سریعتر از رقباست.
- قابلیت توان عملیاتی: یک کارت گرافیک میتواند قابلیت تولید متن ۷۰۱۳ توکن بر ثانیه و ظرفیت پردازش تصویر ۱۳۴۴² با سرعت ۵۴.۷۹ تصویر بر ثانیه را با عملکرد کارایی چشمگیر به دست آورد.
۳. هسته فنی: LLaVA-UHD v4 سربار را کاهش میدهد
دلیل اینکه این مدل میتواند «سبکوزن» باشد، به دلیل فناوری LLaVA-UHD v4 است که به طور مشترک توسط هوش مصنوعی مینگشی و دانشگاه چینهوا توسعه یافته است:
- بازسازی رمزگذاری: با بازسازی رمزگذاری تصویر ViT و ماژولهای فشردهسازی سطحی، سربار رمزگذاری تصویر ۵۰٪ و عملیات ممیز شناور با وضوح بالا ۵۵.۸٪ کاهش مییابد.
- مکانیزم فشردهسازی هیبریدی: این فناوری به طور نوآورانه از فشردهسازی توکن هیبریدی ۴x/16x پشتیبانی میکند که امکان جابجایی انعطافپذیر بین «اولویت عملکرد» و «اولویت سرعت» را فراهم میآورد. این فناوری قبلاً در مدل بزرگ توصیهگر OneRec کوایشو (Kuaishou) تأیید شده و از درخواستهای ترافیکی عظیم پشتیبانی میکند.
۴. پیادهسازی اکوسیستمی: از آزمایشگاه تا خط مقدم صنعت
متنباز بودن MiniCPM-V4.6 نه تنها یک پیروزی فنی، بلکه یک پیروزی اکوسیستمی نیز هست:
- توسعه آسان: این مدل با فریمورکهای تنظیم دقیق مانند ms-swift و LLaMA-Factory سازگاری عمیقی دارد و به توسعهدهندگان اجازه میدهد با یک GPU RTX4090 تنظیمات کامل را انجام دهند.
- سازگاری کامل با پلتفرم: این مدل از فریمورکهای اصلی مانند vLLM و Ollama پشتیبانی میکند و نسخههای آزمایشی را برای iOS، Android و HarmonyOS ارائه میدهد که هوش مصنوعی را قادر میسازد به اشکال بیشتری از پایانههای سختافزاری برسد.
- توانمندسازی پیادهسازی: در حال حاضر، این سری در چندین زمینه مانند خودرو، رایانه شخصی، خانه هوشمند و بازرسی صنعتی پیادهسازی شده است و شرکای آن شامل شرکتهای پیشرو صنعتی مانند لنوو (Lenovo)، جیلی (Geely)، سایک فولکسواگن (SAIC Volkswagen)، شیائومی (Xiaomi) و اوپو (OPPO) هستند.