محققان در یک پیشرفت جدید، چارچوب تازهای به نام «Ego Scene Augmentation» یا به اختصار ESA معرفی کردهاند که به مدلهای چندوجهی (MLLMs) کمک میکند درک فضایی بسیار دقیقتری از دیدگاه اولشخص (Egocentric) داشته باشند.
این مدل با استفاده از یک ساختار گرافمحور، جزئیات محیطی را بهتر تحلیل میکند و باعث افزایش قابلتوجه دقت در پاسخگویی به سوالات بصری (VQA) در محیطهای داخلی و خارجی شده است. این دستاورد میتواند گام بزرگی برای تعامل هوش مصنوعی با دنیای واقعی و رباتهای خودمختار باشد.
🔗 جزئیات بیشتر و کدهای پروژه برای علاقهمندان در دسترس قرار گرفته است.
منبع: arXiv Computer Vision
