دنیای مهندسی داده بهشدت به SQL وابسته است، اما تحقیقات جدید در مقالهای با عنوان «OurBench» نشان میدهد که مدلهای زبانی فعلی هنوز با دنیای واقعی فاصله دارند! 🤖📉
طبق این پژوهش جدید:
🔹 محققان اولین بنچمارک تخصصی (OurBench) را برای ارزیابی توانایی مدلها در شناسایی خطاهای نحوی و معنایی در کدهای پیچیده SQL طراحی کردهاند.
🔹 نتایج نگرانکننده است: حتی مدل قدرتمندی مثل Claude-4-Sonnet در تشخیص باگهای این حوزه موفقیت کمتر از ۴۰٪ داشته و اکثر مدلها حتی زیر ۲۰٪ عمل کردهاند.
این یعنی با وجود پیشرفتهای زیاد، هوش مصنوعی در پروژههای بزرگ سازمانی که کدهای چند صد خطی دارند، هنوز به «نظارت انسانی» نیاز جدی دارد. به نظر شما هوش مصنوعی چه زمانی به یک برنامهنویس بدون خطای پایگاه داده تبدیل میشود؟ 🤔
منبع: arXiv AI
