🚀 معرفی معماری جدید SEMA: انقلابی در کارایی مدل‌های بینایی ماشین!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدید خود از مدل SEMA (Scalable and Efficient Mamba like Attention) رونمایی کردند. این مدل با هدف رفع چالش‌های مدل‌های ترنسفورمر، به‌ویژه مشکل «تفرق توجه» در مقیاس‌های بزرگ، معرفی شده است.

نکات کلیدی این دستاورد:
✅ استفاده از تکنیک بومی‌سازی توکن‌ها (Token Localization) برای حفظ تمرکز مدل.
✅ بهره‌گیری از میانگین‌گیری حسابی برای درک بهتر ویژگی‌های جهانی تصاویر.
✅ عملکرد درخشان‌تر در مقایسه با مدل‌های Vision Mamba فعلی روی دیتاست ImageNet-1k.

این مدل ثابت می‌کند که می‌توانیم بدون فدا کردن دقت، سرعت و بهره‌وری مدل‌های هوش مصنوعی بینایی را به شکل چشمگیری افزایش دهیم. دنیای معماری‌های جایگزین ترنسفورمرها با سرعت عجیبی در حال پیشرفت است! 🔥

منبع: arXiv Computer Vision