🔍 فراتر از کلیشه‌ها: آیا مدل‌های بینایی-زبانی واقعاً می‌بینند؟ 🖼️

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های بینایی-زبانی (VLM) گاهی اوقات به‌جای توجه به واقعیتِ موجود در تصویر، بر اساس پیش‌فرض‌های ذهنی خود پاسخ می‌دهند. اما چطور می‌توان آن‌ها را مجبور کرد به «آنچه واقعاً در تصویر است» تکیه کنند؟

محققان در پژوهشی جدید، بنچمارک PriVE-Bench را معرفی کرده‌اند که با استفاده از تصاویر ضدواقعی (Counterfactual)، توانایی مدل‌ها را در تفکیک واقعیت از پیش‌فرض‌های نادرست به چالش می‌کشد. علاوه بر آن، ابزار PriVE-Tools با افزودن قابلیت‌هایی مثل زوم کردن، برش و کادربندی به عامل‌های بینایی (Agentic Vision)، به مدل‌ها کمک می‌کند تا با دقت بیشتری استدلال کرده و خطاهای ناشی از «توهم بصری» را کاهش دهند. این گام بزرگی برای هوشمندتر و دقیق‌تر شدن چشمان هوش مصنوعی است! 👁️✨

منبع: arXiv AI