یکی از چالشهای اصلی مدلهای بینایی-زبانی (VLM)، تبدیل دستورات متنی پیچیده به ماسکهای دقیق پیکسلی (Reasoning Segmentation) است. روشهای فعلی معمولاً اطلاعات را به نقاط یا کادرهای ساده تبدیل میکنند که باعث هدررفتِ جزئیات و ایجاد نویز میشود.
مدل جدید DGSeg با استفاده از یک معماری هوشمند، دادههای فضایی و معنایی را به صورت مجزا پردازش کرده و با یک ماژولِ «گیتینگ پویا»، نویزها را حذف و نتایج را به دقیقترین شکل ممکن ترکیب میکند. نتایج تستهای این مدل روی دیتاسیتهای چالشبرانگیزی مثل ReasonSeg واقعاً تحسینبرانگیز است! 🎯
اگر در حوزه بینایی ماشین کار میکنید، کدهای این مدل را در گیتهاب بررسی کنید:
🔗 https://github.com/RZZeng/DGSeg
منبع: arXiv Computer Vision
