مدلهای چندوجهی (MLLMs) با وجود پیشرفتهای بزرگ، هنوز در کارهای پیچیده منطقی و استدلالهای گامبهگام بصری چالش دارند. حالا محققان چارچوب جدیدی به نام ProLaViT را معرفی کردهاند که به مدلها اجازه میدهد به جای تکیه بر ابزارهای خارجی، «تفکرات بصری» خود را به صورت ساختاریافته در فضای نهفته (Latent Space) شکل دهند.
این مدل با استفاده از یک مکانیسم خود-تقطیر (Self-distillation)، دقت استدلالی خود را بدون نیاز به ابزارهای سنگین در زمان استنتاج، به شکل چشمگیری افزایش میدهد. دو قابلیت جذاب این مدل شامل «زنجیره علّی از کلی به جزئی» برای کارهای فضایی و «استدلال دیالکتیکی» برای حل مسائل منطقی است. 🔍
منبع: arXiv Computer Vision
