در تاریخ ۳۱ ژوئیه، علیبابا بهطور رسمی مدل بزرگ تشخیص گفتار Qwen-Audio-3.0-ASR را با شعار «بدون افت کلمات در صوتهای طولانی و بدون نیاز به آموزش اصطلاحات تخصصی» معرفی کرد. این مدل اکنون در پلتفرم «بایلیان» (BaiLian) علیبابا در دسترس کاربران قرار دارد.
پنج ارتقای کلیدی در مدل جدید
این مدل در پنج حوزه اصلی بهبود یافته است:
- حافظه متنی طولانی: امکان ارجاع به محتوای پیشین در جلسات چندساعته را فراهم میکند که باعث حفظ ثبات در نامها و مفاهیم فنی میشود و مشکل تکهتکه شدن متن را برطرف میکند.
- واژهنامههای تخصصی داخلی: با نرخ بازیابی ۹۵.۳۶ درصد برای اصطلاحات پزشکی و ۹۱.۸۷ درصد برای برنامهنویسی IT، شناسایی دقیق عبارات پیچیده را بدون تنظیمات دستی ممکن میسازد.
- سفارشیسازی لایهای کلمات کلیدی: واژگان خاص هر سازمان بلافاصله اعمال میشوند و نرخ بازیابی را در اکثر سناریوها به بیش از ۹۹ درصد میرسانند.
- بهینهسازی یکپارچه صدا: حذف کلمات پرکننده، پاکسازی تکرارها و اصلاحات خودکار در یک مرحله انجام میشود تا متنی با خوانایی بالا تولید شود.
- پشتیبانی از بیش از ۳۰ زبان: این مدل با میانگین نرخ خطای معنایی ۱۷.۰۹ درصد در هفت زبان، عملکردی فراتر از مدلهای صنعتی نظیر Azure و Gemini دارد.
همچنین مدل Qwen-Audio-3.0-ASR-Streaming برای سناریوهای بلادرنگ طراحی شده که با تأخیر خروجی ۳۰۰ میلیثانیه و نرخ خطای پایین در محیطهای صنعتی، پیشرو در صنعت محسوب میشود. این سری پیشتر با نرخ خطای ۱.۷ درصد در ارزیابیهای جهانی رتبه اول را کسب کرده و در حوزههایی مانند صورتجلسات، زیرنویسهای زنده و خدمات مشتریان هوشمند کاربرد گستردهای دارد.
