محققان در پژوهشی جدید، معمای عجیبی را در مدلهای بینایی-زبانی (VLM) حل کردهاند: چرا مدلها گاهی اوقات سوال را قبل از تصویر نمیفهمند؟ این «پارادوکس پرسش-اول» باعث میشود مدلها در پاسخدهی گیج شوند.
راهکار هوشمندانه دانشمندان؟ «پژواک پرسش» (Question Echoing)! 🗣️
این روشِ ساده اما قدرتمند، سوال را هم قبل از تصویر و هم بعد از آن قرار میدهد. کپی اول به مدل کمک میکند که «بداند کجا را نگاه کند» و کپی دوم باعث میشود مدل در زمان پاسخدهی، سوال را به خوبی به یاد بیاورد.
این تکنیک بدون نیاز به آموزش مجدد (Training-free)، دقت مدلها را در درک تصاویر به طرز چشمگیری بالا میبرد. جالب است بدانید این ایده از روشی ۵۰ ساله در یادگیری انسانها الهام گرفته شده است! 🧠✨
منبع: arXiv AI
