🚀 ارزیابی هوشمندانه حافظه در مدل‌های زبانی؛ معرفی بنچمارک RECON

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا هوش مصنوعی واقعاً می‌تواند محتواهای طولانی را درک کند و منطق پشت آن‌ها را تحلیل کند؟ محققان به‌تازگی بنچمارک جدیدی به نام RECON معرفی کرده‌اند تا محدودیت‌های حافظه در ایجنت‌های هوشمند را به چالش بکشند.

این بنچمارک با استفاده از ۲۴ پرونده پیچیده در حوزه‌های پزشکی، مالی و جنایی (تا ۱۰۰ هزار توکن)، توانایی استدلال مدل‌ها را در شرایطی مثل تغییرات زمانی و تعارض اطلاعات ارزیابی می‌کند. نتایج نشان می‌دهد که حتی قدرتمندترین سیستم‌های فعلی نیز در این زمینه با چالش‌های جدی مواجه هستند و راه زیادی تا «استدلال منطقی کامل» در متون طولانی باقی مانده است. 🧠💡

منبع: arXiv AI