تا به حال فکر کردهاید که مدلهای بینایی ماشین چطور تشخیص میدهند که یک تصویر حاوی چیست؟ محققان بهتازگی راهکار جدیدی برای «تفسیرپذیری» (Attribution) مدلهای هوش مصنوعی ارائه دادهاند.
در این پژوهش، دو متد جدید به نامهای CoPAIR و TRACE معرفی شدهاند که به مدل کمک میکنند بهجای بررسی کل تصویر، دقیقاً روی بخشهایی از تصویر که بیشترین تأثیر را در تصمیمگیری نهایی داشتهاند (Evidence mask)، تمرکز کنند.
این پیشرفت نه تنها دقت مدلهای بزرگی مثل CLIP و Qwen2.5-VL را در درک محتوا افزایش میدهد، بلکه برای سیستمهای MLLM که نیاز به استدلال دقیق روی تصویر دارند، یک گام بزرگ رو به جلو محسوب میشود. 🚀
منبع: arXiv Computer Vision
