دانشمندان حوزه هوش مصنوعی بهتازگی متوجه شدهاند که اکثر بنچمارکهای فعلی برای سنجش درک متنهای طولانی (Long-Context) در مدلهای زبانی (LLM) بیش از حد ساده هستند یا دقت کافی را ندارند. 📖💡
حالا با معرفی «PredicateLongBench»، روشی نوآورانه برای سنجش «عمق استدلال» در متنهای بسیار طولانی ارائه شده است. در این تست، مدلها باید بتوانند زنجیرههای طولانی از کلمات را بر اساس محدودیتها و قوانین خاص شناسایی کنند. نتیجه این آزمایش نشان میدهد که مدلهای پیشرو فعلی، وقتی با سناریوهای دشوار و پیچیده مواجه میشوند، همچنان با محدودیتهای جدی روبرو هستند.
این تحقیق نشان میدهد که راه زیادی تا رسیدن به درکِ واقعاً «هوشمندانه» در پردازش حجم وسیعی از اطلاعات باقی مانده است.
منبع: arXiv AI
