تنسنت (Tencent) بهطور رسمی نسل جدید مدل تشخیص گفتار خود با نام Hy ASR3.0 preview را معرفی کرد. این مدل برای نخستین بار قابلیتهای درک معنایی عمیق مدل زبانی بزرگ Hy3 را با تشخیص گفتار با دقت بالا ترکیب کرده است. این تحول، تشخیص گفتار را از مرحله «رونویسی کلمه به کلمه و بهینهسازی نقطهای» به مرحله «درک زمینه، سازگاری با سناریوهای مختلف و خروجی مستقیم» ارتقا میدهد.
بر اساس اطلاعات رسمی، این مدل جدید در ارزیابیهای چندبعدی عملکرد درخشانی داشته است: در مجموعههای ارزیابی متنباز، نرخ خطای کلمه (WER) برای زبانهای ماندارین، انگلیسی و کانتونی به ترتیب به ۳.۳۴٪، ۲.۶۲٪ و ۳.۱۲٪ رسیده است که نرخ کلی آن در حدود ۳٪ است. همچنین در مجموعههای ارزیابی داخلی که شامل تشخیص عمومی، بیش از ده گویش، درک معنایی متنی، تشخیص اصطلاحات تخصصی و سناریوهای صوتی پیچیده مانند محیطهای پر سر و صدا و نجوا میشود، این مدل همچنان نرخ خطای پیشرو در صنعت را حفظ کرده است.
تحولات فنی در Hy ASR3.0
ارتقای قابلیتهای Hy ASR3.0 نتیجه بهینهسازی کامل زنجیره پردازش است: معماری این مدل از نوع MoE (ترکیب متخصصان) است که تعادلی میان کارایی و عملکرد ایجاد میکند و پایه آن به مدل بزرگ Hy3 ارتقا یافته است. همچنین، یک رمزگذار صوتی بدون نظارت (Unsupervised) اختصاصی در آن گنجانده شده که با آموزش روی دهها میلیون ساعت داده صوتی، استخراج ویژگیهای آکوستیک را بهبود میبخشد.
در مرحله پیشآموزش، رمزگذار صوتی و مدل زبانی بزرگ بهصورت مشترک آموزش دیدهاند که دادههای عظیمی با گویشها، لهجهها و محیطهای صوتی متنوع را پوشش میدهد. در مرحله پسآموزش نیز، یک مجموعه داده SFT شامل بیش از ۲۰ منطقه گویشی ایجاد شده که با یادگیری تقویتی چندمرحلهای ترکیب شده است تا مشکلاتی نظیر تشخیص اشتباه یا عدم تشخیص در سناریوهای پیچیده را بهطور خاص برطرف کند.
