محققان در مقاله جدیدی، فریمورک «SciTrek» را معرفی کردند که توانایی مدلهای بزرگ زبانی (LLM) را در انجام محاسبات عددی پیچیده روی متون علمی طولانی به چالش میکشد. 🧪
نکته جالب اینجاست که حتی پیشرفتهترین مدلهای فعلی هم در تحلیل مقالات علمی و انجام عملیاتهای ساده مثل مرتبسازی و آمارگیری، عملکرد ضعیفی (کمتر از ۵۰ درصد دقت!) دارند. این پژوهش نه تنها نقاط ضعف مدلها را در تحلیل متون طولانی (بیش از ۱۲۸ هزار توکن) فاش میکند، بلکه ابزاری برای بهبود یادگیری و تقویت توانایی استدلال عددی در دنیای علم ارائه میدهد.
منبع: arXiv AI
