شرکت علیبابا بهطور رسمی از مدل تشخیص گفتار مقیاسبزرگ Qwen-Audio-3.0-ASR-Flash رونمایی کرد که هدف اصلی آن، توانمندسازی هوش مصنوعی برای درک دقیق اصطلاحات تخصصی است. این مدل در سه حوزه کلیدی شامل ثبات در متن، تشخیص واژگان تخصصی صنایع و شخصیسازی کلمات کلیدی، بهینهسازیهای سیستماتیک انجام داده است. همچنین این مدل از قابلیت اصلاح گفتار برخوردار بوده و میتواند خروجی را بهصورت متن ساختاریافته ارائه دهد.

تیم تحقیقاتی علیبابا با استخراج مداوم واژگان حرفهای از حوزههایی نظیر مراقبتهای بهداشتی، برنامهنویسی، بازارهای بورس و چهرههای اجتماعی، پایگاه دادهای باکیفیت برای صنایع مختلف ایجاد کرده است. در آخرین ارزیابیهای داخلی، این مدل جدید بهبود چشمگیری در دقت شنیداری نشان داده و در سناریوهای پزشکی به دقت ۹۵.۳۶ درصد دست یافته است.
سه نسخه برای پنج سناریو؛ پیشتاز در رتبهبندی جهانی
سری Qwen-Audio-ASR-Flash در سناریوهایی مانند تنظیم صورتجلسات، زیرنویسهای همزمان، ضبطهای آموزشی و خدمات مشتریان هوشمند مورد آزمایش قرار گرفته است. این مدل پیشتر با نرخ خطای ۱.۷ درصد، رتبه اول جهانی را در پلتفرم ارزیابی هوش مصنوعی Artificial Analysis کسب کرده بود. این دستاورد به معنای آن است که دقت تبدیل گفتار به متن در محیطهای اداری و آموزشی به سقف کارایی رسیده است.
این مدل اکنون از طریق پلتفرم Alibaba Cloud BaiLian در دسترس است و در سه نسخه ارائه میشود: نسخه Flash برای تشخیص گفتار همزمان تا ۵ دقیقه، نسخه Filetrans برای تبدیل فایلهای آفلاین و نسخه Streaming برای تشخیص گفتار زنده. زمانی که هوش مصنوعی نه تنها «میشنود»، بلکه اصطلاحات پیچیده فنی را نیز درک میکند، میتوان گفت که آخرین مانع در تعاملات صوتی در حال برطرف شدن است.
