🔍 آیا هوش مصنوعی در آزمون‌ها تقلب می‌کند؟ معرفی بنچمارک‌های پویا!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از بزرگترین چالش‌های فعلی در دنیای مدل‌های زبانی (LLM)، نشت داده‌هاست؛ یعنی مدل‌ها پاسخ سوالات بنچمارک را در مرحله آموزش می‌بینند و در عمل حفظیات خود را تحویل می‌دهند! 🧠

محققان در یک پژوهش جدید، «بنچمارک‌های پویا» (Dynamic Benchmarking) را معرفی کرده‌اند. این روش با تغییرات ساختاری و معنایی در کدهای برنامه‌نویسی، سوالات آزمون را به شکلی تغییر می‌دهد که برای مدل جدید به نظر برسند. نتایج جالب است: عملکرد همه مدل‌های محبوب در این آزمون افت محسوسی داشته و حتی رتبه‌بندی آن‌ها تغییر کرده است! این یعنی راهکاری برای واقعی‌تر کردن سنجش هوش مصنوعی پیدا شده است. 💡

‌نویسی

منبع: arXiv NLP