سیستمهای شناسایی گوینده معمولاً در شرایط ایدهآل (صوت و تصویر کامل) کار میکنند، اما در دنیای واقعی با مشکلاتی مثل نویز، قطعی دوربین یا چندزبانه بودن افراد مواجه هستیم.
چالش جدید «POLY-SIM 2026» با هدف استانداردسازی و ارتقای دقت مدلهای هوش مصنوعی برای شناسایی گوینده در شرایط پیچیده و چندوجهی راهاندازی شده است تا سیستمها بتوانند بدون در نظر گرفتن محدودیتهای زبانی یا نقص در دادههای بصری، به درستی عمل کنند. این قدم مهمی برای واقعیتر شدن دستیارهای صوتی و امنیتی است.
منبع: arXiv Computer Vision
