مدلهای چندوجهی (LMM) معمولاً برای درک تصاویر، آنها را به متن تبدیل میکنند که باعث از دست رفتن جزئیات دقیق فضایی میشود. اما مدل جدیدی به نام «LanteRn» این محدودیت را با «تفکر بصری در فضای نهفته» (Latent Space) برطرف کرده است.
این مدل به جای تکیه بر توصیفات متنی، از «جایگشتهای فکری بصری» برای پردازش مستقیم تصاویر استفاده میکند که باعث افزایش چشمگیر دقت در استدلالهای دقیق و درک جزئیات ظریف میشود. نتایج تستهای این مدل روی بنچمارکهای سختگیرانهای مثل VisCoT و Blink، نویدبخشِ آیندهای کارآمدتر برای بینایی ماشین است. 🚀
منبع: arXiv Computer Vision
