به گزارش رسانه فناوری TestingCatalog، مایکروسافت در حال آزمایش اولین مدل صوتی بلادرنگ و بومی خود با نام MAI Realtime است. این مدل از ۱۶ زبان و دو سبک صوتی پشتیبانی میکند و امکان شنیدن و صحبت کردن همزمان در طول مکالمه را فراهم میآورد. همچنین، این سیستم از تشخیص خودکار زبان و تغییر زبان در حین گفتگو پشتیبانی میکند؛ به این معنی که کاربران نیازی ندارند منتظر بمانند تا هوش مصنوعی صحبتش را تمام کند، که این امر تجربه مکالمه را به تعاملات انسانی نزدیکتر میکند.

مدل MAI Realtime از روش تعامل دوطرفه (Full-Duplex) استفاده میکند که الگوی سنتی «کاربر صحبت میکند، سپس مدل پاسخ میدهد» را در دستیارهای صوتی میشکند. این سیستم با استفاده از فناوری تشخیص نقطه پایان (Endpoint Detection)، شروع، مکث و پایان گفتار را شناسایی میکند. هنگامی که کاربران در حین گفتگو صحبت میکنند، مدل میتواند بلافاصله خروجی خود را برای دستیابی به شنیدن و پاسخدهی همزمان تنظیم کند. این یک گام کلیدی برای خانواده مدلهای صوتی MAI در مایکروسافت است که از ارتباط یکطرفه به دوطرفه حرکت میکند؛ مدلهای قبلی مانند MAI-Voice-2 و MAI-Transcribe-1.5 تنها قادر به انجام وظایف یکطرفه مانند سنتز گفتار یا تشخیص گفتار بودند.
دو سبک صوتی طبیعیتر، اما بدون قابلیت آواز خواندن
از نظر پوشش زبانی، MAI Realtime از ۱۶ زبان از جمله چینی، انگلیسی، ژاپنی، کرهای، فرانسوی، آلمانی، عربی و غیره پشتیبانی میکند. کاربران میتوانند زبان مکالمه را مشخص کنند یا قابلیت تشخیص خودکار را فعال نمایند تا مدل در حین گفتگو به طور خودکار زبان را شناسایی و تغییر دهد. در بخش سبک صوتی، نسخه آزمایشی دو صدا با نامهای Victoria و Grant را ارائه میدهد که گفته میشود نسبت به حالت صوتی فعلی Copilot طبیعیتر هستند.
