محققان در مقاله جدیدی به بررسی جالبی در مورد عملکرد Vision Transformers پرداختند. برخلاف شبکههای عصبی کانولوشنی (CNN)، مدلهای ViT به صورت پیشفرض فاقد سوگیریهای استقرایی سلسلهمراتبی هستند، اما مشاهده شده که در لایههای میانی خود نوعی «گلوگاه القایی» (Inductive Bottleneck) ایجاد میکنند.
نتایج این تحقیق نشان میدهد که این گلوگاه، یک نقص طراحی نیست، بلکه یک «سازگاری هوشمندانه» با دادههاست. مدلها در لایههای میانی اطلاعات اضافه را فشرده میکنند تا بتوانند مفاهیم انتزاعیتر و ویژگیهای اصلی اشیاء را بهتر استخراج کنند. به زبان سادهتر: مدل در میانه راه، جزئیات کماهمیت را حذف میکند تا تمرکز اصلی روی سوژه نهایی باشد! 🎯
این یافته به ما کمک میکند تا درک بهتری از نحوه یادگیری مدلهای بینایی ماشین داشته باشیم و معماریهای بهینهتری طراحی کنیم.
منبع: arXiv Computer Vision
