به مناسبت سالگرد تأسیس خود، Fish Audio به طور رسمی قدرتمندترین مدل بزرگ گفتار در سطح تولیدی خود را تا به امروز، یعنی S2.1Pro، عرضه کرد. برخلاف سیستمهای سنتی تبدیل متن به گفتار (TTS) که برای روایتهای از پیش نوشته شده طراحی شدهاند، این مدل به طور خاص برای سناریوهای گفتگوی بلادرنگ ساخته شده و اکنون از طریق API شرکت Fish Audio در دسترس است، با یک نسخه رایگان که محدودیتهای معقولی را برای اهداف توسعه و آزمایش ارائه میدهد.

از نظر عملکرد فنی، S2.1Pro به تأخیر پخش صوتی فریم اول تقریباً ۹۰ میلیثانیه دست مییابد که به طور یکپارچه از نوبتگیری طبیعی و روان در مکالمات پشتیبانی میکند؛ این مدل از ۸۳ زبان پشتیبانی کرده و از یک معماری تشخیص گفتار یکپارچه استفاده میکند. از نظر انعطافپذیری کنترل صدا، این مدل از محدودیتهای منوهای احساسی از پیش تعیین شده رها شده و امکان جاسازی مستقیم تگهای براکت آزاد را در متن فراهم میکند تا دستورالعملهای دقیق و درونخطی مانند نجوا و خندههای عصبی را به دقت پیادهسازی کند.
علاوه بر این، S2.1Pro به طور بومی از تولید گفتگوی چند گوینده پشتیبانی میکند و میتواند با تنها ۱۰ تا ۳۰ ثانیه نمونه مرجع کوتاه، شبیهسازی صدای با کیفیت بالا را انجام دهد و لحن و سبک گفتاری هدف را بدون نیاز به تنظیمات دقیق اضافی، به دقت بازتولید کند.
عرضه S2.1Pro نشاندهنده تکامل سریع هوش مصنوعی گفتار از سنتز مبتنی بر متن به سمت حالتهای گفتگوی بلادرنگ با تأخیر فوقالعاده کم و تعامل با کیفیت بالا است و زیرساخت محاسباتی با موانع کمتر و در دسترسپذیری بالا را برای استقرار جهانی تعامل گفتاری هوشمند فراهم میکند.
