🚀 دقتِ بالاتر در تشخیصِ بصری؛ معرفی DGSeg برای Segmentation دقیق‌تر

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از چالش‌های اصلی مدل‌های بینایی-زبانی (VLM)، تبدیل دستورات متنی پیچیده به ماسک‌های دقیق پیکسلی (Reasoning Segmentation) است. روش‌های فعلی معمولاً اطلاعات را به نقاط یا کادرهای ساده تبدیل می‌کنند که باعث هدررفتِ جزئیات و ایجاد نویز می‌شود.

مدل جدید DGSeg با استفاده از یک معماری هوشمند، داده‌های فضایی و معنایی را به صورت مجزا پردازش کرده و با یک ماژولِ «گیتینگ پویا»، نویزها را حذف و نتایج را به دقیق‌ترین شکل ممکن ترکیب می‌کند. نتایج تست‌های این مدل روی دیتاسیت‌های چالش‌برانگیزی مثل ReasonSeg واقعاً تحسین‌برانگیز است! 🎯

اگر در حوزه بینایی ماشین کار می‌کنید، کدهای این مدل را در گیت‌هاب بررسی کنید:
🔗 https://github.com/RZZeng/DGSeg

منبع: arXiv Computer Vision