یکی از بزرگترین چالشهای فعلی در دنیای مدلهای زبانی (LLM)، نشت دادههاست؛ یعنی مدلها پاسخ سوالات بنچمارک را در مرحله آموزش میبینند و در عمل حفظیات خود را تحویل میدهند! 🧠
محققان در یک پژوهش جدید، «بنچمارکهای پویا» (Dynamic Benchmarking) را معرفی کردهاند. این روش با تغییرات ساختاری و معنایی در کدهای برنامهنویسی، سوالات آزمون را به شکلی تغییر میدهد که برای مدل جدید به نظر برسند. نتایج جالب است: عملکرد همه مدلهای محبوب در این آزمون افت محسوسی داشته و حتی رتبهبندی آنها تغییر کرده است! این یعنی راهکاری برای واقعیتر کردن سنجش هوش مصنوعی پیدا شده است. 💡
نویسی
منبع: arXiv NLP
