تنسنت هونیان (Tencent Hunyuan) رسماً مدل تشخیص گفتار نسل جدید Hy ASR3.0 Preview را عرضه کرده است که نشاندهنده مرحلهای نوین در فناوری تشخیص گفتار، از «رونویسی کلمه به کلمه» به «درک متنی» است. این مدل بر پایه جدیدترین نسل مدل زبان بزرگ Hy3 ساخته شده و قابلیتهای تشخیص گفتار با دقت بالا و درک معنایی عمیق را یکپارچه میکند. هدف اصلی آن دستیابی به یک جهش کیفی است: اینکه هوش مصنوعی نه تنها هر کلمه را به وضوح بشنود، بلکه واقعاً بفهمد شما چه میگویید.

پشتیبانی از ده منطقه گویشی، با عملکرد برجسته در سناریوهای صوتی طولانی
از نظر پوشش، Hy ASR3.0 Preview نیازی به ماندارین استاندارد ندارد. این مدل از ۱۰ منطقه گویشی اصلی، از جمله کانتونی و وو، و بیش از ۲۰ زیرمنطقه فرعی پشتیبانی میکند. دادههای ارزیابی منبعباز نشان میدهد که نرخ خطای کلمه (WER) این مدل برای چندین زبان در حدود ۳٪ کنترل شده است؛ ماندارین با ۳.۳۴٪، انگلیسی با ۲.۶۲٪ و کانتونی با ۳.۱۲٪. دقت کلی آن در حال حاضر نزدیک به سقف صنعت است.
با ترکیب قابلیتهای درک زبان Hy3، این مدل میتواند با در نظر گرفتن متن، قصد کاربر را به دقت تشخیص دهد، ابهامات را به طور خودکار از بین ببرد و همآواها را به هوشمندی تصحیح کند. در سناریوهایی مانند صورتجلسات و مصاحبههای صوتی طولانی، این رویکرد «اول درک کن، سپس رونویسی کن» مزایای قابل توجهی را نشان میدهد؛ در حالی که رونویسی سنتی کلمه به کلمه اغلب با ابهامات همآوایی دست و پنجه نرم میکند، Hy ASR3.0 میتواند کلمات صحیح را بر اساس منطق معنایی به طور خودکار انتخاب کند.
معماری MoE به عنوان پایه، آموزشدیده با میلیونها ساعت داده
در سطح فنی، این مدل از معماری MoE (Mixture of Experts) استفاده میکند که تعادل بین کارایی و عملکرد را برقرار میسازد و پایه آن به Hy3 ارتقا یافته است. تیم هونیان یک Encoder گفتار بدون نظارت (unsupervised speech Encoder) را توسعه داده که بر روی دهها میلیون ساعت داده گفتاری بدون نظارت آموزش دیده تا نمایشهای صوتی با کیفیت بالا را از فایلهای صوتی پیچیده استخراج کند. Encoder مسئول «خوب شنیدن» است، در حالی که Hy3 مسئول «درست فهمیدن» است.
در زمینه استراتژی داده، تیم آموزش مشترک Encoder گفتار و مدل زبان بزرگ را انجام داد و دهها میلیون ساعت داده گفتاری چندمنبعی را معرفی کرد. از طریق تزریق قابلیت چندمرحلهای، مدل قادر به آگاهی از متن، سازگاری با سناریوهای پیچیده و توانایی تشخیص گویش شد. فاز پس از آموزش بر ایجاد یک راهحل SFT (Supervised Fine-Tuning) با کیفیت بالا تمرکز دارد که پوششدهنده تشخیص عمومی، درک متنی و پایداری در سناریوهای پیچیده است و شامل متن، اصطلاحات تخصصی، محیطهای صوتی مختلف و ورودیهای صوتی متنوع میشود. همچنین یک رویکرد یادگیری تقویتی چندمرحلهای برای بهینهسازی مداوم سناریوهای پیچیده و کمتر رایج معرفی شده است.
