مدلهای چندوجهی (MLLM) گاهی در تشخیص دقیق اشیاء در تصویر یا ویدیو دچار «توهم» میشوند. حالا محققان روش جدیدی به نام MTLA معرفی کردهاند که بدون نیاز به آموزش مجدد (Training-free)، به مدل کمک میکند تا دقیقاً بداند به کدام بخش از تصویر یا داده توجه کند.
✅ چرا این خبر مهم است؟
این تکنیک با تحلیل دقیقتر توجه مدل (Attention)، خطاهای تشخیص را به شدت کاهش میدهد و دقت مدلها را در تستهای استاندارد تقریباً دو برابر کرده است. این یعنی قدمی بزرگ به سوی هوش مصنوعیِ دقیقتر و قابلاعتمادتر در بینایی ماشین!
منبع: arXiv AI
