محققان در تلاشند تا بفهمند مدلهای زبانی بزرگ (LLM) چقدر در تحلیل اسناد بسیار طولانی (مثل گزارشهای فنی یا رمانها) توانمند هستند. اغلب بنچمارکهای فعلی از دادههای مصنوعی استفاده میکنند که تفاوت زیادی با دنیای واقعی دارند.
بنچمارک جدید WILDTRACE با ۴۸۱ وظیفه مختلف، روی متون واقعی و ساختار طبیعیِ اسناد تمرکز کرده است تا ببیند آیا هوش مصنوعی میتواند به طور منطقی شواهد پراکنده در یک متن طولانی را به هم وصل کند یا خیر. این گام بزرگی برای رسیدن به هوش مصنوعی با استدلالهای دقیقتر و عمیقتر در دنیای واقعی است.
منبع: arXiv AI
