اوپنایآی در تاریخ ۲۹ جولای دو موتور شنیداری جدید را منتشر کرد. مدلهای رونویسی GPT-Live-Transcribe و GPT-Transcribe اکنون از طریق API در دسترس هستند. اینها دیگر فقط ابزارهای سادهای نیستند که صدا را به متن تبدیل کنند؛ بلکه در حال یادگیری درک زمینه پشت یک جمله هستند – لهجهها، اصطلاحات تخصصی، اعداد و حتی نویز پسزمینه مکالمات دیگر به راحتی آنها را گیج نمیکند.
ویژگیها و کاربردهای مدلهای جدید
هر یک از این دو مدل ویژگیهای خاص خود را دارند. GPT-Live-Transcribe برای سناریوهای بیدرنگ با تأخیر کم طراحی شده است، مانند یک تندنویس که همزمان با گوینده آنچه را که گفته میشود مینویسد. هزینه آن ۰.۰۱۷ دلار در دقیقه است. GPT-Transcribe بر فایلهای صوتی کامل و وظایف دستهای تمرکز دارد و از رویکرد رونویسی ناهمزمان استفاده میکند، با قیمت ۰.۰۰۴۵ دلار در دقیقه، که آن را برای پردازش انبوه ضبطها پس از اتمام کار مناسبتر میسازد.
درک زمینه، نقطه قوت اصلی
پیشرفت واقعی در توانایی آنها برای درک زمینه نهفته است. در معیار Context Aware ASR، نرخ دقت معنایی GPT-Transcribe از ۴۱.۶٪ بدون زمینه آزاد به ۴۵.۲٪ با ارائه زمینه افزایش یافت – این مدل شروع به درک این میکند که یک کلمه میتواند در مکالمات مختلف معانی کاملاً متفاوتی داشته باشد.
مقایسه با Whisper و کاهش نرخ خطا
در مقایسه با مدل قدیمیتر Whisper، مدل جدید برتری آشکاری کسب کرده است. در ۲۲ زبانی که توسط Common Voice پوشش داده شدهاند، GPT-Transcribe نرخ خطای رونویسی را به ۱۹.۲۷٪ کاهش داد، در حالی که Whisper (whisper-1) در ۴۰.۳۷٪ باقی ماند که بیش از دو برابر نرخ خطا است؛ هنگامی که روی ۹ زبان در ضبطهای واقعی آزمایش شد، نرخ خطا را به ۸.۹۸٪ کاهش داد، که بسیار پایینتر از ۱۵.۲۱٪ Whisper است. هنگامی که ماشینها میتوانند اصطلاحات حرفهای را در محیطهای پر سر و صدا به وضوح درک کنند، به نظر میرسد که در تعامل صوتی کمی بیشتر باز شده است.
