🚀 جهش در درک هوشمند تصاویر با مدل DDVT

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا هوش مصنوعی می‌تواند مثل یک انسان به تصاویر دقیق نگاه کند و به سوالات ما درباره جزئیات آن‌ها پاسخ دهد؟ محققان به تازگی مدل جدیدی به نام «DDVT» معرفی کرده‌اند که در زمینه «Visual Question Answering» (پاسخ‌دهی به سوالات بصری) عملکرد خیره‌کننده‌ای دارد.

این مدل با ترکیب هوشمندانه قابلیت‌های بینایی و متنی (Vision-Language)، می‌تواند بخش‌های دقیق یک تصویر که مرتبط با سوال کاربر است را شناسایی کرده و با دقت بسیار بالا به سوالات پاسخ دهد. DDVT با استفاده از ماژول‌های پیشرفته، پیوند بین پیکسل‌های تصویر و متن سوال را تقویت کرده و در تست‌های استاندارد، نتایج بهتری نسبت به روش‌های فعلی کسب کرده است. 💡

منبع: arXiv Computer Vision