مدلهای زبانی چندوجهی (MLLM) در تشخیص اشیاء کلی عالی عمل میکنند، اما وقتی پای «جزئیات» یا اجزای کوچک یک شیء وسط میآید، معمولاً دچار سردرگمی میشوند.
محققان برای حل این مشکل، مدل جدیدی به نام OP-HRG معرفی کردهاند که با استفاده از یادگیری تقویتی (Reinforcement Learning)، به جای یک نگاه کلی، از یک استراتژی «کل به جزء» استفاده میکند. این مدل ابتدا شیء اصلی را پیدا کرده و سپس با دقت روی اجزای کوچکتر آن متمرکز میشود.
نتایج شگفتانگیز است: یک مدل ۴ میلیارد پارامتری با این روش، توانسته مدلهای ۷ میلیاردی فعلی را در بخشبندی و درک اجزای اشیاء شکست دهد! این یعنی درکِ بهترِ هوش مصنوعی از دنیای اطراف. 🧠✨
منبع: arXiv Computer Vision
