تیم Seed بایتدنس از مدل بزرگ SeedRealtime رونمایی کرد؛ مدلی که با استفاده از یک معماری یکپارچه، صوت، تصویر و متن را بهصورت بومی ادغام میکند تا تعاملات طبیعی و بلادرنگ با قابلیت «دیدن، شنیدن و صحبت کردن» را فراهم آورد. این فناوری اکنون از مرحله آزمایشگاهی خارج شده و بهطور کامل در اپلیکیشن Doubao پیادهسازی شده است که نشاندهنده اولین استقرار در مقیاس بزرگ فناوری تمامدوطرفه (Full-duplex) صوتی و تصویری است.

تفاوت اصلی SeedRealtime در مقایسه با راهکارهای آبشاری سنتی، در معماری آن نهفته است. سیستمهای آبشاری معمولاً از توالی «شنیدن، تبدیل به متن، فکر کردن و صحبت کردن» پیروی میکنند که در آن ادراک و بیان توسط ماژولهای جداگانه مدیریت میشوند؛ این امر منجر به ناهماهنگی در ریتم گفتگو میشود. در مقابل، SeedRealtime ادراک و بیان صوتی و تصویری را در یک مدل سرتاسری (End-to-End) واحد متحد میکند و به مدل اجازه میدهد بهطور همزمان ورودیهای بصری و صوتی را دریافت کرده و مستقیماً پاسخ تولید کند. این یکپارچگی بومی، مشکلات ریتم گفتاری در مکالمات صوتی و تصویری را به نصف کاهش داده و مسائلی مانند همپوشانی کلام، مکثهای ناگهانی یا پاسخهای نامرتبط را از بین میبرد.
نکته قابلتوجه دیگر، «درک زمانبندی» این مدل در سناریوهای بلادرنگ است؛ این مدل میتواند بهصورت فعال یادآوری کند و بهطور طبیعی مکث داشته باشد تا مانند مکالمات انسانی، فضای تنفس ایجاد شود، نه اینکه تمام اطلاعات را یکباره ارائه دهد. برای یک دستیار هوشمند چندوجهی، این رویکردی نوین است که بهجای تکیه بر زنجیرهای از مدلهای تکوجهی، به یک مدل واحد اجازه میدهد تا همزمان دارای چشم، گوش و زبان باشد.
