🔍 آیا معیارهای ارزیابی هوش مصنوعی در تشخیص ناهنجاری‌ها قابل اعتمادند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، معیارهای فعلی «تشخیص ناهنجاری در سری‌های زمانی» (TSAD) را زیر ذره‌بین برده‌اند. نتایج این بررسی نشان می‌دهد که بسیاری از روش‌های رایج، در برابر دست‌کاری و «بهینه‌سازیِ تصادفی» آسیب‌پذیر هستند.

این مقاله ثابت می‌کند که انتخابِ بهترین نتیجه از میان تلاش‌های متعدد (N-attempts)، می‌تواند باعث شود برخی معیارها به طرز کاذبی عالی به نظر برسند، در حالی که در واقعیت عملکرد ضعیفی دارند. این یافته‌ها اهمیتِ بازنگری در بنچمارک‌های ارزیابیِ مدل‌های هوش مصنوعی را بیش از پیش نمایان می‌کند. 📊🤖

منبع: arXiv Machine Learning