تولید گراف صحنه (Scene Graph Generation) یکی از چالشهای اصلی در بینایی ماشین است. محققان به تازگی در مقالهای جذاب، تفاوت عملکرد دو رویکرد اصلی «مبتنی بر آشکارساز» (Detector-based) و «مبتنی بر پرسوجو» (Query-based) را بررسی کردهاند. 🔍
آنها با معرفی متد جدید Dual-SGG، این دو روش را با هم ترکیب کردهاند تا با استفاده از نقاط قوت هر دو، خروجی بسیار دقیقتری برای درک روابط موجود در تصاویر ارائه دهند. این دستاورد میتواند گام بزرگی برای بهبود فهم بصری هوش مصنوعی در محیطهای پیچیده باشد. 🖼️🤖
منبع: arXiv Computer Vision
