آیا مدلهای هوش مصنوعی واقعاً در تحلیل دادههای پیچیده دنیای واقعی تبحر دارند؟ تحقیقات جدید نشان میدهد که معیارهای فعلی ارزیابی (Benchmarks) هنوز با شرایط عملی فاصله زیادی دارند.
محققان برای حل این مشکل، بنچمارک جدیدی به نام «DataGovBench» را معرفی کردهاند که بر اساس دادههای دولتی طراحی شده است. این ابزار، توانایی مدلها را در:
✅ پاسخ به سوالات پیچیده چندجدولی
✅ تحلیل اکتشافی دادهها (Exploratory Data Analysis)
✅ تولید بینشهای تخصصی و بصریسازی
به چالش میکشد. نتایج نشان میدهد که مدلهای فعلی، حتی با فریمورکهای ایجنتیک، هنوز برای تحلیل دادههای دنیای واقعی نیاز به پیشرفتهای اساسی دارند.
منبع و کدها در گیتهاب قرار گرفته است.
منبع: arXiv AI
