🧠 پایان توهم در مدل‌های بینایی-زبانی (LVLM) با روشی هوشمندانه!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های بزرگ بینایی-زبانی گاهی دچار «توهم» (Hallucination) می‌شوند و جزئیاتی را به اشتباه از تصاویر استخراج می‌کنند. روش‌های فعلی برای جلوگیری از این مشکل، اغلب باعث می‌شوند مدل در بیش از ۸۰٪ مواقع از پاسخ دادن خودداری (Abstain) کند که عملاً کارایی را به شدت کاهش می‌دهد.

محققان با معرفی روش جدید BCEA (اکتساب شواهد با بودجه‌بندی)، راهکار هوشمندانه‌ای پیدا کرده‌اند. حالا مدل به جای انتخاب بین «پاسخ دادن» یا «سکوت»، می‌تواند شواهد بیشتری را از تصویر جمع‌آوری کند (مثل زوم کردن یا بررسی دقیق‌تر بخش‌های خاص). با این روش، مدل قبل از دادن پاسخ نهایی، بررسی می‌کند که آیا شواهد کافی برای تایید ادعایش دارد یا خیر. این یعنی تعادلی بهتر بین دقت و کارایی! 🔍✨

منبع: arXiv Computer Vision