محققان در مطالعه جدیدی به سراغ مقایسه دو ساختار محبوب در بینایی ماشین رفتهاند: «Vision Mamba» و «MambaOut». سوال اینجاست که آیا SSMها واقعاً برای بینایی ضروری هستند؟
نکته جالب اینجاست که این دو مدل با وجود عملکرد مشابه، استراتژیهای متفاوتی برای پردازش اطلاعات دارند:
🔹 مدل MambaOut: تمرکز بر اطلاعات کلاسبندی در نواحی پیشزمینه تصویر.
🔹 مدل Vision Mamba: توزیع اطلاعات در نواحی پسزمینه و تکیه بر جهت توکنها برای تصمیمگیری.
این یافتهها نشان میدهد که نحوه «نگاه کردن» مدلهای هوش مصنوعی به تصاویر، بسیار پیچیدهتر از آن چیزی است که فکر میکردیم و هر ساختار ویژگیهای منحصر به فردی را در پردازش بصری برجسته میکند.
منبع: arXiv AI
