محققان در مقالهای جدید، نسل جدیدی از عوامل هوشمند (Agents) را معرفی کردهاند که مشکل بزرگ مدلهای فعلی، یعنی «انفجار توکنهای بصری» و کاهش دقت در گفتگوهای طولانی را حل میکند.
این مدل که با نام «Cognitive-structured Multimodal Agent» معرفی شده، از سه بخش کلیدی تشکیل شده است:
۱. موتور انتزاع ادراکی برای درک ساختاریافته تصاویر.
۲. موتور بازیابی شناختی برای دسترسی هوشمند به حافظه رویدادی (Episodic Memory).
۳. کنترلکننده اجرایی برای برنامهریزی عملیاتی.
نتایج فوقالعاده است: این مدل ۸ میلیارد پارامتری توانسته در دقت بازیابی اطلاعات، از مدلهای ۳۲ میلیارد پارامتری سبقت بگیرد و در عین حال، سرعت پاسخگویی را به شدت افزایش دهد! این یعنی آیندهای که در آن هوش مصنوعی در گفتگوهای طولانی و پیچیده، کمتر فراموش میکند و سریعتر عمل میکند. 🚀
منبع: arXiv Computer Vision
