🤖 چرا ترتیب پرسش در مدل‌های بینایی-زبانی مهم است؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پژوهش جدید کشف کرده‌اند که مدل‌های چندوجهی (VLMs) نسبت به ترتیب ورودی‌ها بسیار حساس هستند. به عبارت ساده‌تر، اگر ابتدا تصویر و سپس سوال را به مدل بدهید، نتیجه‌گیری دقیق‌تری نسبت به برعکس آن دریافت می‌کنید!

این مطالعه نشان می‌دهد که این «حساسیت به ترتیب» یک نقص در ساختار داخلی شبکه است. تیم محققان برای رفع این مشکل، یک روش جدید آموزش در زمان تست (Test-Time Training) طراحی کرده‌اند که نه تنها این شکاف عملکرد را پر می‌کند، بلکه باعث بهبود دقت کلی مدل در هر دو حالت می‌شود. 🚀

این دستاورد گام مهمی در جهت ساخت مدل‌های منطقی‌تر و قابل‌اعتمادتر است. نظر شما چیست؟ آیا هوش مصنوعی باید نسبت به ساختار چیدمان داده‌ها تا این حد وابسته باشد؟

منبع: arXiv NLP