🧠 پیشرفت چشمگیر در مدل‌های چندوجهی: ظهور عامل هوشمند با «حافظه بصری»

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید، نسل جدیدی از عوامل هوشمند (Agents) را معرفی کرده‌اند که مشکل بزرگ مدل‌های فعلی، یعنی «انفجار توکن‌های بصری» و کاهش دقت در گفتگوهای طولانی را حل می‌کند.

این مدل که با نام «Cognitive-structured Multimodal Agent» معرفی شده، از سه بخش کلیدی تشکیل شده است:
۱. موتور انتزاع ادراکی برای درک ساختاریافته تصاویر.
۲. موتور بازیابی شناختی برای دسترسی هوشمند به حافظه رویدادی (Episodic Memory).
۳. کنترل‌کننده اجرایی برای برنامه‌ریزی عملیاتی.

نتایج فوق‌العاده است: این مدل ۸ میلیارد پارامتری توانسته در دقت بازیابی اطلاعات، از مدل‌های ۳۲ میلیارد پارامتری سبقت بگیرد و در عین حال، سرعت پاسخگویی را به شدت افزایش دهد! این یعنی آینده‌ای که در آن هوش مصنوعی در گفتگوهای طولانی و پیچیده، کمتر فراموش می‌کند و سریع‌تر عمل می‌کند. 🚀

منبع: arXiv Computer Vision