🔍 راز معماری ویژن ترنسفورمرها (ViT) کشف شد! 🧠

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی به بررسی جالبی در مورد عملکرد Vision Transformers پرداختند. برخلاف شبکه‌های عصبی کانولوشنی (CNN)، مدل‌های ViT به صورت پیش‌فرض فاقد سوگیری‌های استقرایی سلسله‌مراتبی هستند، اما مشاهده شده که در لایه‌های میانی خود نوعی «گلوگاه القایی» (Inductive Bottleneck) ایجاد می‌کنند.

نتایج این تحقیق نشان می‌دهد که این گلوگاه، یک نقص طراحی نیست، بلکه یک «سازگاری هوشمندانه» با داده‌هاست. مدل‌ها در لایه‌های میانی اطلاعات اضافه را فشرده می‌کنند تا بتوانند مفاهیم انتزاعی‌تر و ویژگی‌های اصلی اشیاء را بهتر استخراج کنند. به زبان ساده‌تر: مدل در میانه راه، جزئیات کم‌اهمیت را حذف می‌کند تا تمرکز اصلی روی سوژه نهایی باشد! 🎯

این یافته به ما کمک می‌کند تا درک بهتری از نحوه یادگیری مدل‌های بینایی ماشین داشته باشیم و معماری‌های بهینه‌تری طراحی کنیم.

منبع: arXiv Computer Vision