محققان در مقالهای جدید، متد نوآورانهای به نام LookME را معرفی کردهاند که تحولی در اجرای مدلهای بینایی-زبانی (VLM) ایجاد میکند.
مشکل اصلی مدلهای بزرگ، مصرف حافظه بسیار بالاست؛ LookME با استفاده از یک سیستم جستجوی دومرحلهای (از سطح صحنه تا جزئیات دقیق)، به مدل اجازه میدهد به جای بارگذاری کامل پارامترها، فقط دادههای ضروری را به صورت «در لحظه» از حافظه جانبی فراخوانی کند. این یعنی عملکرد بهتر در دستگاههای با منابع محدود و سرعت بالاتر در تحلیل محتوای چندوجهی! 🧠✨
این پیشرفت میتواند راه را برای اجرای مدلهای هوشمند بسیار بزرگ روی سیستمهای شخصی هموارتر کند.
های_چندوجهی
منبع: arXiv AI
