محققان در یک مطالعه جدید به بررسی توانایی مدلهای زبانی (مثل XLM-RoBERTa) در تشخیص اخبار جعلی زبان اردو پرداختهاند. نتیجه جالب این پژوهش نشان میدهد که این مدلها گاهی به جای تحلیل محتوا، گرفتار «میانبرهای آماری» میشوند!
نکته کلیدی اینجاست که در برخی مجموعهدادهها، تفاوت طولِ متن در اخبار جعلی و واقعی باعث میشود مدلها یاد بگیرند فقط بر اساس «کوتاه یا بلند بودن» متن قضاوت کنند، نه محتوای واقعی. این تحقیق یک متدولوژی دقیق برای عیبیابی و جلوگیری از این خطاهای سیستماتیک ارائه داده است تا دقت هوش مصنوعی در زبانهای کممنبع (Low-resource) بهبود یابد. 📉🤖
منبع: arXiv NLP
