🧠 آیا بنچمارک‌های حافظه هوش مصنوعی فریب‌دهنده هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید، چالش بزرگی را در ارزیابی «حافظه طولانی‌مدت» در مدل‌های زبانی بزرگ (LLM) مطرح کرده‌اند. آن‌ها معتقدند معیارهای فعلی نمی‌توانند به‌خوبی نشان‌دهنده توانایی مدل در بازیابی اطلاعات دقیق از متون علمی باشند.

نکات کلیدی این پژوهش:
🔹 معرفی دو بنچمارک جدید به نام‌های PAIM و PTr برای ارزیابی دقیق‌تر در متون علمی.
🔹 اثبات اینکه برتری برخی مدل‌ها در لیدربوردها تنها به دلیل استفاده از «بودجه بازیابی» (Context Budget) بسیار بالا است و نه هوشمندی مدل!
🔹 تاکید بر اینکه ترکیب روش‌های بازیابی Sparse و Dense (هیبرید)، کلید اصلی رسیدن به دقت بالاتر است.

این مقاله زنگ خطری برای توسعه‌دهندگان است که هنگام ارزیابی مدل‌های ایجنتیک، فریب امتیازهای خام را نخورند و به جزئیات پروتکل‌های ارزیابی توجه بیشتری کنند.

منبع: arXiv AI