تا حالا فکر کردید که یک مدل هوش مصنوعی در پاسخ به سوال شما، چقدر از اطلاعاتش را از «زمینه» (Context) موجود در ورودی گرفته و چقدر از «وزنهای» (Weights) یادگرفته شده در زمان آموزش؟
محققان در یک پژوهش جدید نشان دادهاند که روشهای فعلی برای تشخیص این موضوع چندان دقیق نیستند! وقتی اطلاعات ورودی با دانستههای قبلی مدل (آموزشدیده در وزنها) همپوشانی دارد، روشهای فعلی دچار سردرگمی میشوند و امتیازات نامعتبر میدهند.
این تیم برای حل این مشکل، یک بنچمارک جدید (WMDP-Cyber++) و معیارهای ارزیابی تازهای معرفی کردهاند تا بفهمیم مدلها واقعاً چگونه استدلال میکنند. این قدم مهمی برای افزایش شفافیت و اعتماد در سیستمهای LLM است! 🧠✨
منبع: arXiv NLP


