محققان در مطالعهای جدید، بنچمارک دقیق و کاربردی به نام «AISE-Bench» را برای سنجش توانایی مدلهای زبانی (LLMs) در کار با دانشنامههای علمی معرفی کردند.
💡 چرا این بنچمارک مهم است؟
مدلهای هوش مصنوعی فعلی در استفاده از ابزارها و APIها برای کارهای پیچیده علمی اغلب دچار ضعف هستند. این بنچمارک با ۱۱۳۳ جفت پرسش و پاسخ، شامل مسیرهای واقعی اجرای API و استدلالهای گامبهگام، به ارزیابی دقیقتر این مدلها کمک میکند.
نتایج اولیه نشان میدهد که حتی قدرتمندترین مدلها مثل Gemini-3-Pro هم در برنامهریزی دقیق برای فراخوانی دادههای علمی با چالش روبرو هستند. این یعنی هنوز فضای زیادی برای پیشرفت «نمایندههای هوشمند» (Agents) وجود دارد! 🧠🔍
منبع: arXiv AI
