تا به حال دقت کردید که مدلهای صوتی (SLMs) گاهی در پردازش همزمان صدا و متن دچار اختلال میشوند؟ این تداخل باعث میشود خروجیها غیرطبیعی و کمهوش به نظر برسند.
محققان در پژوهشی جدید، فریمورک نوآورانه «Lychee-FD» را معرفی کردهاند که با یک استراتژی هوشمندانه، تداخل بین لایههای صوتی و معنایی را در مدلهای فولدوبلکس (Full-Duplex) از بین میبرد.
نتایج این روش شگفتانگیز است:
✅ بهبود ۷.۴ درصدی در پاسخدهی هوشمند به سوالات (Spoken QA)
✅ افزایش چشمگیر ۲۸.۵ درصدی در روانی تعاملات دوطرفه!
این پیشرفت یعنی دستیارهای صوتی آینده بسیار طبیعیتر و باهوشتر با ما صحبت خواهند کرد. 🧠✨
منبع: arXiv NLP
