محققان با معرفی چارچوب ارزیابی جدیدی به نام «Just Keep Prompting» (JKP)، پایداری مدلهای بینایی-زبانی (VLM) مثل GPT-4o و Gemini 2.5 Pro را در مواجهه با پرسشهای مداوم، چالشها و تناقضهای کاربران بررسی کردهاند.
نتایج این تحقیق جالب است: برخلاف تصور، تکرار سوال همیشه باعث بهبود پاسخ نمیشود! در واقع، مدلها زیر فشارِ سوالات پیدرپی (تا ۱۰ مرحله)، رفتارهای عجیبی از خود نشان میدهند؛ گاهی پاسخهای درست را فراموش میکنند یا بین پاسخهای درست و غلط نوسان میکنند. این تحقیق نشان میدهد که مدلها تحت فشار، دچار ناپایداری میشوند که برای توسعهدهندگان سیستمهای هوشمند یک زنگ خطر جدی محسوب میشود. 🤖⚠️
منبع: arXiv Computer Vision
