مدلهای زبانی-تصویری (VLM) در تحلیل کیفیت تصاویر پیشرفتهای خوبی داشتند، اما اغلب در ارائه امتیازات دقیق دچار مشکل «فروپاشی مقادیر» (Discrete Collapse) میشدند.
محققان برای حل این مشکل، چارچوب جدید ME-IQA را معرفی کردهاند. این روش با استفاده از یک حافظه کمکی (Memory Bank) و تکنیکهای بازرتبهبندی، دقت ارزیابی کیفیت تصاویر را به طرز چشمگیری افزایش میدهد و باعث میشود نتایج بسیار حساستر و دقیقتر از قبل باشند. این یک گام مهم برای بهبود مدلهای بینایی ماشین در تشخیص کیفیت بصری است! 🚀
منبع: arXiv Computer Vision
