مدلهای چندوجهی (MLLM) تا امروز در تشخیص اشیا عالی بودند، اما در درک روابط پیچیده بین آنها ضعف داشتند. حالا محققان با معرفی تکنیک SaGe (Scene Graph Thinking)، این مشکل را حل کردهاند.
این روش جدید با استفاده از «گرافهای صحنه»، به جای دیدنِ تکتک اجزا، ساختار روابط بین اشیا را درک میکند. نتیجه؟ عملکرد بسیار دقیقتر در وظایف بصری پیچیده که نیاز به استدلال منطقی دارد. با این رویکرد، مدلهای هوش مصنوعی میتوانند مثل انسان، جزئیات محیط را با دقتِ ساختاریافته تحلیل کنند. 🚀
این پیشرفت میتواند به زودی در رباتیک و سیستمهای بینایی ماشین تحولی بزرگ ایجاد کند.
منبع: arXiv Computer Vision
