محققان تکنیک جدیدی به نام «LOCUS» را معرفی کردهاند که مشکل اصلی مدلهای چندوجهی (MLLM) در درک جزئیات دقیق تصاویر (Fine-grained perception) را هدف گرفته است.
گاهی مدلها تصویر را میبینند اما چون جزئیات در میان اطلاعات اضافی گم میشود، دچار «پوسیدگی بافت بصری» (Visual context rot) میشوند. سیستم LOCUS با استفاده از یک تمرین آموزشی هوشمند، به مدل یاد میدهد که چگونه نشانههای بصری کوچک را جستوجو و روی شواهد کلیدی تصویر تمرکز کند. خبر خوب این است که این تغییر فقط در زمان آموزش است و برای کاربر نهایی، رابط کاربری بدون تغییر و بسیار دقیقتر عمل میکند! ✅
منبع: arXiv Computer Vision
