مدلهای بینایی-زبانی (VLM) گاهی اوقات بهجای توجه به واقعیتِ موجود در تصویر، بر اساس پیشفرضهای ذهنی خود پاسخ میدهند. اما چطور میتوان آنها را مجبور کرد به «آنچه واقعاً در تصویر است» تکیه کنند؟
محققان در پژوهشی جدید، بنچمارک PriVE-Bench را معرفی کردهاند که با استفاده از تصاویر ضدواقعی (Counterfactual)، توانایی مدلها را در تفکیک واقعیت از پیشفرضهای نادرست به چالش میکشد. علاوه بر آن، ابزار PriVE-Tools با افزودن قابلیتهایی مثل زوم کردن، برش و کادربندی به عاملهای بینایی (Agentic Vision)، به مدلها کمک میکند تا با دقت بیشتری استدلال کرده و خطاهای ناشی از «توهم بصری» را کاهش دهند. این گام بزرگی برای هوشمندتر و دقیقتر شدن چشمان هوش مصنوعی است! 👁️✨
منبع: arXiv AI
