مدلهای بزرگ بینایی-زبانی (LVLM) با وجود توانمندیهای خیرهکننده، هنوز با مشکل «توهم» (Hallucination) دست و پنجه نرم میکنند؛ یعنی گاهی چیزهایی را میبینند که وجود ندارد! 😵💫
محققان در مطالعه اخیر خود، فریمورک نوآورانه «SDPR» را معرفی کردهاند که بدون نیاز به آموزش مجدد مدل، توهمات را کاهش میدهد. این ابزار با تمرکز بر بازتوزیع توجه (Attention) و حفظ ویژگیهای بصری در حافظه پنهان، دقت پاسخدهی هوش مصنوعی را به شدت بالا میبرد. مزیت بزرگ این روش این است که بدون سربار پردازشی اضافه، روی مدلهای مختلف قابل اجراست. 🚀
منبع: arXiv Computer Vision
