آیا میدانستید امتیازهایی که شرکتها برای «قابلیت اعتماد» مدلهای هوش مصنوعی (مثل Qwen یا Mistral) منتشر میکنند، ممکن است با بهروزرسانیهای جدید مدل تغییر کند؟
محققان در یک پژوهش جدید روی ۱۲ مدل متنباز نشان دادهاند که «دریافت» (Drift) در عملکرد مدلها اتفاق میافتد؛ یعنی وقتی مدل آپدیت میشود، لزوماً امتیاز قبلیاش معتبر نیست. این مطالعه پیشنهاد میدهد که امتیازهای بنچمارک باید مثل یک «کارت سلامت» تاریخدار برای هر نسخه از مدل ثبت شوند تا کاربران دچار سوءتفاهم نشوند. نکتهای حیاتی برای توسعهدهندگانی که بر پایه این مدلها سیستمهای حساس میسازند! 💡
منبع: arXiv Machine Learning
