محققان در یک پژوهش جدید کشف کردهاند که مدلهای چندوجهی (VLMs) نسبت به ترتیب ورودیها بسیار حساس هستند. به عبارت سادهتر، اگر ابتدا تصویر و سپس سوال را به مدل بدهید، نتیجهگیری دقیقتری نسبت به برعکس آن دریافت میکنید!
این مطالعه نشان میدهد که این «حساسیت به ترتیب» یک نقص در ساختار داخلی شبکه است. تیم محققان برای رفع این مشکل، یک روش جدید آموزش در زمان تست (Test-Time Training) طراحی کردهاند که نه تنها این شکاف عملکرد را پر میکند، بلکه باعث بهبود دقت کلی مدل در هر دو حالت میشود. 🚀
این دستاورد گام مهمی در جهت ساخت مدلهای منطقیتر و قابلاعتمادتر است. نظر شما چیست؟ آیا هوش مصنوعی باید نسبت به ساختار چیدمان دادهها تا این حد وابسته باشد؟
منبع: arXiv NLP
