محققان در مقاله جدیدی به یک مشکل اساسی در مدلهای بینایی-زبانی (VLM) پی بردهاند: ابزارهای خودکار بهینهسازی پرامپت (APO) معمولاً فقط متنها را میبینند و از تحلیل محتوای تصویری که مدل در آن شکست خورده، عاجزند! 🖼️❌
حالا با معرفی تکنیک Cross-Modal Visual Feedback (CMVF)، هوش مصنوعی میتواند هنگام یادگیری، مستقیماً به سراغ «تصاویرِ چالشبرانگیز» برود و با تحلیل بصری دقیق، نقاط کور خود را شناسایی کند. نتیجه؟ عملکرد بسیار دقیقتر در تحلیل تصاویر بدون نیاز به هزینههای پردازشی اضافه در زمان اجرا. این یعنی هوش مصنوعی حالا میتواند مثل یک متخصص، چکلیستهای بصری برای خودش بسازد! 🚀
منبع: arXiv AI
