تا حالا دقت کردید که مدلهای چندوجهی (MLLM) گاهی در تشخیص تصاویرِ دارای «خطای دید» (Visual Illusion) دچار مشکل میشوند؟ در حالی که برای انسان این تصاویر واضح هستند، هوش مصنوعی بهدلیل «سوگیری توجه به فرکانس بالا» در جزئیات پسزمینه گم میشود.
محققان با معرفی راهکار جدید SMSP، این مشکل را حل کردهاند! این چارچوبِ «پلاگانپلی» با فیلتر کردن سیگنالهای اضافی، درک مدل را به دیدِ انسانی نزدیکتر میکند. نتیجه؟ دقت مدلهایی مثل Qwen3 در تشخیص تصاویر گیجکننده، از ۱۳ درصد به ۸۴ درصد جهش داشته است! 🚀
این یک گام بزرگ برای واقعیتر شدن بینایی ماشین است.
منبع: arXiv Computer Vision
