محققان در مطالعهای جدید به یک نقطه ضعف بزرگ در سیستمهای ارزیابی هوش مصنوعی در حوزه تولید گفتار پی بردهاند. برخلاف تصور رایج، معیارهای فعلی که از «جاسازیهای احساسی» (Emotion Embeddings) برای سنجش کیفیت استفاده میکنند، چندان قابل اعتماد نیستند! 🎙️🤖
این تحقیق نشان میدهد که مدلهای فعلی به جای یادگیری واقعی «احساسات» در گفتار، بیشتر روی تقلید آکوستیک و ویژگیهای سطحی تمرکز دارند و تداخلهای زبانی و گوینده باعث میشود ارزیابیها با درک انسانی از احساسات فاصله زیادی داشته باشد. این یعنی مسیر ما برای رسیدن به مدلهای واقعاً همدل و با احساس هنوز با چالشهای فنی مهمی روبروست. 🧐
منبع: arXiv NLP
