یکی از چالشهای بزرگ در بینایی ماشین، فهمیدن جزئیات دقیق یک تصویر بر اساس توصیفات متنی (REC) است. در اکثر روشهای فعلی، مدلها نمیتوانند روابط ساختاری بین اشیاء را بهخوبی درک کنند.
محققان بهتازگی چارچوب جدیدی به نام SVCR را معرفی کردهاند که به جای نگاه کردن به اجزای جداگانه تصویر، روابط بین اشیاء را به صورت ساختاریافته مدلسازی میکند. این یعنی هوش مصنوعی حالا میتواند با دقت بسیار بیشتری متوجه شود که در یک عکس، چه چیزی دقیقاً به چه چیزی اشاره دارد! 🖼️✨
این پیشرفت نه تنها دقت مدلها را در آزمایشهای استاندارد به سطح جدیدی رسانده، بلکه گامی مهم برای درک عمیقتر ارتباط میان زبان و دنیای بصری است.
منبع: arXiv Computer Vision
