مدلهای بزرگ بینایی-زبانی گاهی دچار «توهم» (Hallucination) میشوند و جزئیاتی را به اشتباه از تصاویر استخراج میکنند. روشهای فعلی برای جلوگیری از این مشکل، اغلب باعث میشوند مدل در بیش از ۸۰٪ مواقع از پاسخ دادن خودداری (Abstain) کند که عملاً کارایی را به شدت کاهش میدهد.
محققان با معرفی روش جدید BCEA (اکتساب شواهد با بودجهبندی)، راهکار هوشمندانهای پیدا کردهاند. حالا مدل به جای انتخاب بین «پاسخ دادن» یا «سکوت»، میتواند شواهد بیشتری را از تصویر جمعآوری کند (مثل زوم کردن یا بررسی دقیقتر بخشهای خاص). با این روش، مدل قبل از دادن پاسخ نهایی، بررسی میکند که آیا شواهد کافی برای تایید ادعایش دارد یا خیر. این یعنی تعادلی بهتر بین دقت و کارایی! 🔍✨
منبع: arXiv Computer Vision
