مدلهای چندوجهی (LMMs) در درک تصاویر عالی هستند، اما وقتی نوبت به جستجوی آنلاین و پردازش اطلاعات طولانی میرسد، معمولاً با چالش «کاهش تمرکز» یا همان context explosion مواجه میشوند. حالا محققان با معرفی POINTS-Seeker راهکار جدیدی پیدا کردهاند!
این مدل با دو نوآوری اصلی معرفی شده:
۱. Agentic Seeding: روشی برای آموزش مدل که به آن یاد میدهد چطور مثل یک دستیار هوشمند از ابزارها استفاده کند.
۲. V-Fold: یک سیستم مدیریت حافظه خلاقانه که بخشهای قدیمیِ اطلاعات را به جای متن، به فضای تصویری منتقل میکند تا مدل گیج نشود و منابعش بهینه بماند.
نتیجه؟ یک مدل ۸ میلیاردی که در بنچمارکهای جستجوی چندوجهی، عملکردی در حد غولهای بزرگتر از خود دارد! این یعنی دسترسی سریعتر و دقیقتر به اطلاعات برای هوش مصنوعی. 🤖🔍
منبع: arXiv Computer Vision
