محققان در یک پژوهش جدید، معیارهای فعلی «تشخیص ناهنجاری در سریهای زمانی» (TSAD) را زیر ذرهبین بردهاند. نتایج این بررسی نشان میدهد که بسیاری از روشهای رایج، در برابر دستکاری و «بهینهسازیِ تصادفی» آسیبپذیر هستند.
این مقاله ثابت میکند که انتخابِ بهترین نتیجه از میان تلاشهای متعدد (N-attempts)، میتواند باعث شود برخی معیارها به طرز کاذبی عالی به نظر برسند، در حالی که در واقعیت عملکرد ضعیفی دارند. این یافتهها اهمیتِ بازنگری در بنچمارکهای ارزیابیِ مدلهای هوش مصنوعی را بیش از پیش نمایان میکند. 📊🤖
منبع: arXiv Machine Learning
