مدلهای بینایی مبتنی بر SSM که جایگزینی برای Vision Transformerها هستند، معمولاً به دلیل «اسکن جهتدار» (Directional Scanning) دچار محدودیتهایی در تشخیص ابعاد و چرخش تصاویر میشوند. اما محققان مدل جدیدی به نام VNCT (Vision Non-Causal Trapezoidal Mamba) معرفی کردهاند که با استفاده از دینامیکهای مرتبه دوم، این محدودیت را کنار میزند!
نکات کلیدی این دستاورد:
✅ حذف اسکن جهتدار: تمام توکنهای تصویر در یک مرحله تعامل میکنند.
✅ مقاومت در برابر چرخش: عملکرد مدل در مواجهه با تصاویر چرخانده یا وارونه بسیار بهتر شده است.
✅ دقت بالاتر: بهبود ۳.۷ واحدی در Boundary IoU و برتری در وظایف اصلی بینایی کامپیوتر مثل تشخیص اشیاء و بخشبندی معنایی.
این یعنی مدلهای بینایی حالا میتوانند بسیار بهینهتر و دقیقتر از قبل محیط اطراف را درک کنند. دنیای SSMها با سرعت عجیبی در حال پیشرفت است! 🤖✨
منبع: arXiv Computer Vision
