بیشتر تحقیقات روی «توهم» (Hallucination) مدلهای بینایی-زبانی (LVLMs) بر توصیف دقیق تصاویر متمرکز است، اما محققان در یک مطالعه جدید به سراغ جنبه کمتر بررسیشدهای رفتهاند: توهم در تخیل داوطلبانه!
این تیم پژوهشی بنچمارک جدیدی به نام VOPE معرفی کردهاند که بررسی میکند وقتی مدلها شروع به «تخیل» و قصهپردازی میکنند، چگونه اشیاء خیالی را درک میکنند. نتایج این تحقیق نشان میدهد که مدلهای فعلی در این زمینه عملکرد ضعیفی دارند و روشهای کاهش توهم هم هنوز کارایی لازم را ندارند.
این یک قدم مهم برای درک بهتر مرز بین خلاقیت و خطای هوش مصنوعی در کاربردهای واقعی است.
منبع: arXiv Computer Vision
