مدلهای هوش مصنوعی امروزی گاهی در درک تصاویر بر اساس توصیفات متنی دچار سردرگمی میشوند، بهویژه وقتی توضیحات متنی ناقص یا مبهم باشند.
محققان در مقاله جدیدی، چارچوب نوآورانه «Text as Partial Constraint» یا به اختصار TPC را معرفی کردهاند که به جای اعتماد کورکورانه به کپشنهای متنی، آنها را به عنوان یک «محدودیت جزئی» در نظر میگیرد. این روش با جداسازی هسته معنایی از جزئیات غیرضروری (باقیماندهها)، باعث میشود مدلها در تشخیص اشیاء و استدلال بینایی-زبانی بسیار دقیقتر و مقاومتر عمل کنند.
نتایج این تحقیق نشان میدهد که مدلهایی مثل LLaVA با استفاده از این تکنیک، در بنچمارکهای مهمی مثل ImageNet و OKVQA بهبود چشمگیری پیدا کردهاند. این یک گام مهم برای رسیدن به مدلهای پایه قابلاعتمادتر است! 🚀
منبع: arXiv AI
