🔍 چالش جدید برای مدل‌های هوش مصنوعی: بنچمارک PredicateLongBench معرفی شد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

دانشمندان حوزه هوش مصنوعی به‌تازگی متوجه شده‌اند که اکثر بنچمارک‌های فعلی برای سنجش درک متن‌های طولانی (Long-Context) در مدل‌های زبانی (LLM) بیش از حد ساده هستند یا دقت کافی را ندارند. 📖💡

حالا با معرفی «PredicateLongBench»، روشی نوآورانه برای سنجش «عمق استدلال» در متن‌های بسیار طولانی ارائه شده است. در این تست، مدل‌ها باید بتوانند زنجیره‌های طولانی از کلمات را بر اساس محدودیت‌ها و قوانین خاص شناسایی کنند. نتیجه این آزمایش نشان می‌دهد که مدل‌های پیشرو فعلی، وقتی با سناریوهای دشوار و پیچیده مواجه می‌شوند، همچنان با محدودیت‌های جدی روبرو هستند.

این تحقیق نشان می‌دهد که راه زیادی تا رسیدن به درکِ واقعاً «هوشمندانه» در پردازش حجم وسیعی از اطلاعات باقی مانده است.

منبع: arXiv AI