آیا تا به حال فکر کردهاید که چرا مدلهای بینایی-زبانی (VLM) گاهی در پاسخ به سوالات پیچیده شکست میخورند؟ پژوهشگران با معرفی بنچمارک CRAG-MM-Diagnostics، برای اولین بار فرآیند پاسخدهی این مدلها را مرحلهبهمرحله کالبدشکافی کردهاند.
این تحقیق نشان میدهد که مشکل اصلی نه فقط در قدرت استدلال، بلکه در مراحل پایه مثل شناسایی اشیاء و بازیابی اطلاعات است. این یافتهها مسیر را برای ساخت سیستمهای RAG هوشمندتر و دقیقتر هموار میکند. ابزاری ضروری برای توسعهدهندگانی که میخواهند مدلهای بیناییمحورِ باکیفیتتری بسازند! 🛠️✨
منبع: arXiv AI
