تنسنت بهطور رسمی نسل جدید مدل تشخیص گفتار خود با نام Hy ASR 3.0 را در قالب نسخه پیشنمایش عرضه کرد. این مدل با بهرهگیری از قابلیتهای درک زبان در مدل زبانی بزرگ Hy3، دقت بالای تشخیص گفتار را با درک عمیق معنایی ترکیب کرده است.
این مدل در ابعاد کلیدی همچون تشخیص عمومی، آگاهی از بافتار (Context)، پایداری در سناریوهای مختلف و پوشش گویشها بهبود چشمگیری یافته است. به گفته تنسنت، این فناوری از مرحله «تبدیل کلمه به کلمه و بهینهسازی تکنقطهای» به مرحله «درک بافتار، سازگاری با سناریو و خروجی یکپارچه» تکامل یافته است تا نتایج دقیقتر، منسجمتر و همسو با قصد کاربر ارائه دهد.

عملکرد این مدل بسیار قابل توجه است. در ارزیابیهای متنباز جهانی، نسخه پیشنمایش Hy ASR 3.0 نرخ خطای کلمه (WER) را در چندین زبان به حدود ۳ درصد کاهش داده است: ۳.۳۴ درصد برای زبان چینی ماندارین، ۲.۶۲ درصد برای انگلیسی و ۳.۱۲ درصد برای کانتونی.
در مجموعه دادههای ارزیابی داخلی تنسنت، این مدل در سناریوهای مختلف از جمله تشخیص عمومی، تشخیص گویشها، درک اصطلاحات تخصصی و شرایط صوتی پیچیده مانند محیطهای پر سر و صدا یا نجوا، نرخ خطای بسیار پایینی را حفظ کرده و در مجموع به کمترین نرخ خطا در میان مدلهای ارزیابیشده دست یافته است.

