آیا هوش مصنوعی میتواند مثل یک انسان به تصاویر دقیق نگاه کند و به سوالات ما درباره جزئیات آنها پاسخ دهد؟ محققان به تازگی مدل جدیدی به نام «DDVT» معرفی کردهاند که در زمینه «Visual Question Answering» (پاسخدهی به سوالات بصری) عملکرد خیرهکنندهای دارد.
این مدل با ترکیب هوشمندانه قابلیتهای بینایی و متنی (Vision-Language)، میتواند بخشهای دقیق یک تصویر که مرتبط با سوال کاربر است را شناسایی کرده و با دقت بسیار بالا به سوالات پاسخ دهد. DDVT با استفاده از ماژولهای پیشرفته، پیوند بین پیکسلهای تصویر و متن سوال را تقویت کرده و در تستهای استاندارد، نتایج بهتری نسبت به روشهای فعلی کسب کرده است. 💡
منبع: arXiv Computer Vision
