📊 بنچمارک جدید برای سنجش هوش مصنوعی در تحلیل داده‌های واقعی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا مدل‌های هوش مصنوعی واقعاً در تحلیل داده‌های پیچیده دنیای واقعی تبحر دارند؟ تحقیقات جدید نشان می‌دهد که معیارهای فعلی ارزیابی (Benchmarks) هنوز با شرایط عملی فاصله زیادی دارند.

محققان برای حل این مشکل، بنچمارک جدیدی به نام «DataGovBench» را معرفی کرده‌اند که بر اساس داده‌های دولتی طراحی شده است. این ابزار، توانایی مدل‌ها را در:
✅ پاسخ به سوالات پیچیده چندجدولی
✅ تحلیل اکتشافی داده‌ها (Exploratory Data Analysis)
✅ تولید بینش‌های تخصصی و بصری‌سازی

به چالش می‌کشد. نتایج نشان می‌دهد که مدل‌های فعلی، حتی با فریم‌ورک‌های ایجنتیک، هنوز برای تحلیل داده‌های دنیای واقعی نیاز به پیشرفت‌های اساسی دارند.

منبع و کدها در گیت‌هاب قرار گرفته است.

منبع: arXiv AI