🔍 رازِ نگاهِ دقیق‌تر هوش مصنوعی؛ «پژواک پرسش» چیست؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جدید، معمای عجیبی را در مدل‌های بینایی-زبانی (VLM) حل کرده‌اند: چرا مدل‌ها گاهی اوقات سوال را قبل از تصویر نمی‌فهمند؟ این «پارادوکس پرسش‌-اول» باعث می‌شود مدل‌ها در پاسخ‌دهی گیج شوند.

راهکار هوشمندانه دانشمندان؟ «پژواک پرسش» (Question Echoing)! 🗣️
این روشِ ساده اما قدرتمند، سوال را هم قبل از تصویر و هم بعد از آن قرار می‌دهد. کپی اول به مدل کمک می‌کند که «بداند کجا را نگاه کند» و کپی دوم باعث می‌شود مدل در زمان پاسخ‌دهی، سوال را به خوبی به یاد بیاورد.

این تکنیک بدون نیاز به آموزش مجدد (Training-free)، دقت مدل‌ها را در درک تصاویر به طرز چشمگیری بالا می‌برد. جالب است بدانید این ایده از روشی ۵۰ ساله در یادگیری انسان‌ها الهام گرفته شده است! 🧠✨

منبع: arXiv AI