🧠 گامی رو به جلو در استدلال بصری هوش مصنوعی: معرفی LanteRn

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های چندوجهی (LMM) معمولاً برای درک تصاویر، آن‌ها را به متن تبدیل می‌کنند که باعث از دست رفتن جزئیات دقیق فضایی می‌شود. اما مدل جدیدی به نام «LanteRn» این محدودیت را با «تفکر بصری در فضای نهفته» (Latent Space) برطرف کرده است.

این مدل به جای تکیه بر توصیفات متنی، از «جایگشت‌های فکری بصری» برای پردازش مستقیم تصاویر استفاده می‌کند که باعث افزایش چشمگیر دقت در استدلال‌های دقیق و درک جزئیات ظریف می‌شود. نتایج تست‌های این مدل روی بنچمارک‌های سخت‌گیرانه‌ای مثل VisCoT و Blink، نویدبخشِ آینده‌ای کارآمدتر برای بینایی ماشین است. 🚀

منبع: arXiv Computer Vision