محققان در مقاله جدید خود از مدل SEMA (Scalable and Efficient Mamba like Attention) رونمایی کردند. این مدل با هدف رفع چالشهای مدلهای ترنسفورمر، بهویژه مشکل «تفرق توجه» در مقیاسهای بزرگ، معرفی شده است.
نکات کلیدی این دستاورد:
✅ استفاده از تکنیک بومیسازی توکنها (Token Localization) برای حفظ تمرکز مدل.
✅ بهرهگیری از میانگینگیری حسابی برای درک بهتر ویژگیهای جهانی تصاویر.
✅ عملکرد درخشانتر در مقایسه با مدلهای Vision Mamba فعلی روی دیتاست ImageNet-1k.
این مدل ثابت میکند که میتوانیم بدون فدا کردن دقت، سرعت و بهرهوری مدلهای هوش مصنوعی بینایی را به شکل چشمگیری افزایش دهیم. دنیای معماریهای جایگزین ترنسفورمرها با سرعت عجیبی در حال پیشرفت است! 🔥
منبع: arXiv Computer Vision
