🔍 اعتماد به مدل‌های زبانی؛ آیا امتیازهای بنچمارک واقعیت دارند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا می‌دانستید امتیازهایی که شرکت‌ها برای «قابلیت اعتماد» مدل‌های هوش مصنوعی (مثل Qwen یا Mistral) منتشر می‌کنند، ممکن است با به‌روزرسانی‌های جدید مدل تغییر کند؟

محققان در یک پژوهش جدید روی ۱۲ مدل متن‌باز نشان داده‌اند که «دریافت» (Drift) در عملکرد مدل‌ها اتفاق می‌افتد؛ یعنی وقتی مدل آپدیت می‌شود، لزوماً امتیاز قبلی‌اش معتبر نیست. این مطالعه پیشنهاد می‌دهد که امتیازهای بنچمارک باید مثل یک «کارت سلامت» تاریخ‌دار برای هر نسخه از مدل ثبت شوند تا کاربران دچار سوءتفاهم نشوند. نکته‌ای حیاتی برای توسعه‌دهندگانی که بر پایه این مدل‌ها سیستم‌های حساس می‌سازند! 💡

منبع: arXiv Machine Learning