دانشمندان متوجه شدند مدلهای چندوجهی (VLMs) گاهی در حل مسائل هندسی دچار سردرگمی میشوند؛ یعنی ممکن است یک مسئله را از طریق متن بهخوبی حل کنند اما با دیدن تصویر همان مسئله شکست بخورند! 📐
برای حل این مشکل، محققان متد جدیدی به نام «MIRROR» طراحی کردهاند. این تکنیک با بررسی «زوایای دید» مختلف (متن، تصویر و ترکیب هر دو)، بهترین پاسخ را به عنوان «معلم» انتخاب میکند و به بقیه مدل آموزش میدهد تا یاد بگیرند چطور در شرایط مختلف، استدلال دقیقتری داشته باشند.
این یعنی در آینده، هوش مصنوعی در درک مسائل بصری و منطقی بسیار منسجمتر و هوشمندتر عمل خواهد کرد. 🚀
منبع: arXiv AI
