یکی از چالشهای بزرگ در دنیای بینایی ماشین، تشخیص دقیق اشیاء در دستهبندیهای بسیار مشابه (Fine-grained) است. مدلهای قدرتمندی مثل CLIP با وجود قابلیتهای عالی، گاهی در درک روابط پیچیده و سلسلهمراتبی میان کلاسها دچار ضعف میشوند.
محققان در مقاله جدیدی روشی به نام SCPT یا «تنظیم پرامپت ساختاریافته و فشرده» را معرفی کردهاند. این متد با دو تکنیک نوآورانه:
۱. رمزگذاری روابط معنایی (SRE): مدل را قادر میسازد تا توپولوژی و روابط بین کلاسها را بهتر درک کند.
۲. تابع زیان تراکم معنایی (ScLoss): دادههای اضافی را حذف کرده و ویژگیهای کلیدی را برای تشخیص دقیقتر برجسته میکند.
این نوآوری به مدلهای بینایی-زبانی کمک میکند تا با دقت بسیار بالاتری جزئیات ظریف تصاویر را تشخیص دهند.
منبع: arXiv Computer Vision
