🚀 معرفی AISE-Bench: چالش جدید برای ارزیابی هوش مصنوعی در جستجوی داده‌های علمی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه‌ای جدید، بنچمارک دقیق و کاربردی به نام «AISE-Bench» را برای سنجش توانایی مدل‌های زبانی (LLMs) در کار با دانش‌نامه‌های علمی معرفی کردند.

💡 چرا این بنچمارک مهم است؟
مدل‌های هوش مصنوعی فعلی در استفاده از ابزارها و APIها برای کارهای پیچیده علمی اغلب دچار ضعف هستند. این بنچمارک با ۱۱۳۳ جفت پرسش‌ و پاسخ، شامل مسیرهای واقعی اجرای API و استدلال‌های گام‌به‌گام، به ارزیابی دقیق‌تر این مدل‌ها کمک می‌کند.

نتایج اولیه نشان می‌دهد که حتی قدرتمندترین مدل‌ها مثل Gemini-3-Pro هم در برنامه‌ریزی دقیق برای فراخوانی داده‌های علمی با چالش روبرو هستند. این یعنی هنوز فضای زیادی برای پیشرفت «نماینده‌های هوشمند» (Agents) وجود دارد! 🧠🔍

منبع: arXiv AI