محققان در دستاورد جدیدی برای مسابقات MLC-SLM 2026، سیستم قدرتمندی برای تشخیص گفتار در مکالمات دو نفره طراحی کردهاند. این سیستم با ترکیب تکنیکهای مدرن «دیارایزیشن» (تفکیک گوینده) و بهینهسازی مدل Qwen3-ASR، توانسته دقت تشخیص گفتار را به شکل چشمگیری افزایش دهد.
از نکات جالب این پژوهش، استفاده از ترکیبی از آموزش نظارتشده (Fine-tuning)، افزایش دادههای صوتی مصنوعی و یادگیری تقویتی (GRPO) برای کاهش خطاهای بازشناسی و جلوگیری از «توهمات» هوش مصنوعی است که خروجی نهایی را بسیار دقیقتر از نسخههای پایه کرده است. این تکنیکها گامی رو به جلو در درک بهتر مکالمات چندزبانه توسط ماشینها محسوب میشوند. 🚀
منبع: arXiv NLP
