🔍 سرابِ «خوداصلاحی» در مدل‌های بینایی؛ چرا هوش مصنوعی در فکر کردنِ طولانی شکست می‌خورد؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدتی است که تصور می‌شود اگر به مدل‌های زبانی-بینایی (VLM) اجازه دهیم بیشتر «فکر کنند»، عملکردشان در تشخیص اشیاء (Grounding) بهتر می‌شود. اما مقاله جدیدی با بررسی متد «تفکر بصری تکرار شونده» (IVT)، نتایج جالبی را به چالش کشیده است! 🧐

محققان متوجه شدند که بهبودهای گزارش‌شده در این مدل‌ها، در واقع یک «سراب» یا خطای اندازه‌گیری است. مدل در حین فرآیند خوداصلاحی، نمی‌تواند به درستی بفهمد کدام تلاشش دقیق‌تر بوده و در عمل، هیچ مزیتی نسبت به پاسخ لحظه اول ندارد. در واقع، این مدل‌ها در «تایید خود» (Self-verification) ضعف شدیدی دارند و حتی نمی‌توانند تشخیص دهند که آیا باکسِ تولید شده صحیح است یا خیر! 📉

این تحقیق یادآوری مهمی است که نباید کورکورانه به خروجی‌های چند مرحله‌ای مدل‌های AI اعتماد کرد، چون گاهی مسیرِ رسیدن به جواب، فقط یک خطای آماری است نه هوشمندی واقعی.

منبع: arXiv AI