مدتی است که تصور میشود اگر به مدلهای زبانی-بینایی (VLM) اجازه دهیم بیشتر «فکر کنند»، عملکردشان در تشخیص اشیاء (Grounding) بهتر میشود. اما مقاله جدیدی با بررسی متد «تفکر بصری تکرار شونده» (IVT)، نتایج جالبی را به چالش کشیده است! 🧐
محققان متوجه شدند که بهبودهای گزارششده در این مدلها، در واقع یک «سراب» یا خطای اندازهگیری است. مدل در حین فرآیند خوداصلاحی، نمیتواند به درستی بفهمد کدام تلاشش دقیقتر بوده و در عمل، هیچ مزیتی نسبت به پاسخ لحظه اول ندارد. در واقع، این مدلها در «تایید خود» (Self-verification) ضعف شدیدی دارند و حتی نمیتوانند تشخیص دهند که آیا باکسِ تولید شده صحیح است یا خیر! 📉
این تحقیق یادآوری مهمی است که نباید کورکورانه به خروجیهای چند مرحلهای مدلهای AI اعتماد کرد، چون گاهی مسیرِ رسیدن به جواب، فقط یک خطای آماری است نه هوشمندی واقعی.
منبع: arXiv AI
