🧠 جهش در استدلال بصری مدل‌های چندوجهی با مدل ProLaViT

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های چندوجهی (MLLMs) با وجود پیشرفت‌های بزرگ، هنوز در کارهای پیچیده منطقی و استدلال‌های گام‌به‌گام بصری چالش دارند. حالا محققان چارچوب جدیدی به نام ProLaViT را معرفی کرده‌اند که به مدل‌ها اجازه می‌دهد به جای تکیه بر ابزارهای خارجی، «تفکرات بصری» خود را به صورت ساختاریافته در فضای نهفته (Latent Space) شکل دهند.

این مدل با استفاده از یک مکانیسم خود-تقطیر (Self-distillation)، دقت استدلالی خود را بدون نیاز به ابزارهای سنگین در زمان استنتاج، به شکل چشمگیری افزایش می‌دهد. دو قابلیت جذاب این مدل شامل «زنجیره علّی از کلی به جزئی» برای کارهای فضایی و «استدلال دیالکتیکی» برای حل مسائل منطقی است. 🔍

منبع: arXiv Computer Vision