محققان در مقاله جدیدی به بررسی چالش «حافظه دیداری» در دستیارهای هوشمند چندوجهی پرداختهاند. وقتی از یک هوش مصنوعی درباره تصویری سوال میپرسید، سیستم باید تصمیم بگیرد چه اطلاعاتی از تصویر را در حافظه (KV Cache) نگه دارد و چه چیزی را پاک کند.
این مطالعه با معرفی چارچوب CVMA نشان میدهد که روشهای فعلی برای تعیین اهمیت بخشهای مختلف یک تصویر اغلب ضعیف عمل میکنند و گاهی اطلاعات حیاتی را به اشتباه حذف میکنند. این تحقیق راهکارهای جدیدی برای بهبود «فراموشی هوشمند» در مدلهای بینایی-زبانی پیشنهاد میدهد تا دقت پاسخدهی آنها در گفتگوهای طولانی افزایش یابد.
منبع: arXiv AI
