xAI مدل جدید تشخیص گفتار خود، Grok Voice Think Fast2.0 را عرضه کرده است که اکنون در دسترس توسعهدهندگانی است که در حال ساخت عوامل مبتنی بر صدا هستند. این مدل بهبودهایی در سطح هوشمندی، دقت رونویسی، قابلیتهای مکالمه و کارایی فراخوانی ابزارها ارائه میدهد. قیمت این مدل ۰.۰۸ دلار برای هر دقیقه صدا است. xAI اعلام کرده است که نیازی به تغییر در پرامپتهای موجود نیست و Think Fast2.0 میتواند در اکثر سناریوهای کاربردی، بهبود عملکردی به ارمغان بیاورد.
در تست بنچمارک تشخیص گفتار Artificial Analysis، Grok Voice Think Fast2.0 امتیاز جامع ۸۲.۹٪ را کسب کرد که بالاتر از ۷۵.۷٪ نسخه قبلی Think Fast1.0 و همچنین فراتر از ۷۹.۱٪ GPT-Realtime-2.1 و ۶۹.۵٪ Gemini3.1Flash است. امتیاز قابلیت عامل آن به ۵۶.۵٪ رسید که از ۵۲.۱٪ Think Fast1.0، ۴۵.۷٪ GPT-Realtime-2.1 و ۳۷.۷٪ Gemini3.1Flash پیشی گرفت. زمان پخش اولیه صدا در این مدل از ۱.۲۵ ثانیه به ۰.۷۰ ثانیه کاهش یافته که سرعت پاسخگویی را بیشتر بهبود میبخشد.

در زمینه رونویسی گفتار، xAI حجم زیادی از کلیپهای صوتی را به ۲۴ زبان آزمایش کرد. دادههای رسمی نشان میدهد که در مقایسه با Deepgram Nova3 و ElevenLabs Scribe v2، دقت رونویسی Think Fast2.0 حدود ۱.۵ تا ۲ برابر بهبود یافته است؛ در مقایسه با مدل نسل قبلی، حدود ۱.۴ برابر بهبود داشته است. xAI میگوید در محیطهای پیچیده مانند نویز پسزمینه و فشردهسازی تلفن، این تفاوت میتواند تا حدود ۱۰ برابر افزایش یابد.
جنبه فنی
Think Fast2.0 از استنتاج گفتار موازی پشتیبانی میکند که با کاهش زمان انتظار، کارایی پردازش را برای کارهای پیچیده بهبود میبخشد. در مقایسه با مدل نسل قبلی، میانگین تعداد توکنهای استنتاجی مورد استفاده به ۰.۴ کاهش یافته است که امکان اجرای فراخوانی ابزارها را معمولاً قبل از تکمیل اولین پاسخ عامل فراهم میکند. در عین حال، یادگیری تقویتی استراتژی مکالمه مدل را بهینهسازی کرده است، به طوری که تمایل به استفاده از پاسخهای کوتاهتر، رسیدگی به یک موضوع در هر زمان و کاهش خروجی اطلاعات نامربوط دارد و بدین ترتیب از گردش کارهای پیچیده بهتر پشتیبانی میکند.
xAI اعلام کرد که این ارتقاء عمدتاً بر افزایش قابلیت اطمینان عوامل صوتی در سناریوهای تجاری واقعی تمرکز دارد. در حال حاضر، Grok Voice در حال آزمایش A/B در خدمات تلفنی Starlink است و بهبودهایی در نرخ تبدیل فروش و کارایی پاسخگویی خدمات مشتری به ارمغان آورده است.
طبق برنامه، در تاریخ ۵ اوت ۲۰۲۶، نام مستعار grok-voice-latest به طور خودکار از grok-voice-think-fast-1.0 به grok-voice-think-fast-2.0 تغییر خواهد کرد. توسعهدهندگانی که همچنان نیاز به استفاده از نسخه قدیمی دارند، باید شناسه نسخه ۱.۰ را از قبل قفل کنند. سایر کاربران نیازی به اقدامات اضافی ندارند.
با ورود تدریجی عوامل هوش مصنوعی به سناریوهای کاربردی عملی مانند خدمات مشتری، فروش و کارهای اداری، مدلهای گفتاری با تأخیر کم، دقت بالا و همکاری چند ابزاری به یک پایه مهم برای مرحله بعدی تعامل هوشمند تبدیل میشوند.
