امروزه پلتفرمهای ابری مثل Snowflake، مدلهای زبانی را مستقیماً با دستورات SQL ترکیب کردهاند تا تحلیل دادهها به سطح جدیدی برسد. اما مشکل اینجاست که بنچمارکهای فعلی برای تست این «SQLهای بومیِ هوشمند» کافی نیستند.
به همین دلیل محققان از «Spider 2.0-AIFunc» رونمایی کردند؛ بنچمارکی شامل ۴۶۵ نمونه واقعی که به دقت آزمایش میکند مدلهای هوش مصنوعی تا چه حد میتوانند دستورات پیچیده SQL را برای کارهای مختلف (مثل تحلیل حس، جستجوی شباهت و استخراج داده) اجرا کنند.
نتایج نشان میدهد که هنوز شکاف عملکردی بین مدلهای پیشرو و سایر مدلها وجود دارد، اما این بنچمارک گام مهمی برای استانداردسازیِ ترکیب قدرت LLMها با پایگاهدادههای سازمانی است. 🚀
منبع: arXiv AI
