محققان تکنیک جدیدی به نام CARPRT معرفی کردهاند که مشکل رایج «پراپتنویسی» در مدلهای بینایی-زبانی (VLM) را حل میکند. تا پیش از این، وزندهی به دستورات (Prompts) برای همه دستهها یکسان بود، اما این متد جدید بهصورت هوشمند و بدون نیاز به آموزش اضافه، اهمیت هر دستور را بر اساس کلاسِ هدف تنظیم میکند.
نتیجه؟ دقت بسیار بالاتر در طبقهبندی تصاویر و درک بهترِ رابطه بین متن و تصویر! این یک گام مهم برای دقیقتر کردن هوش مصنوعی در تحلیل دادههای بصری است. 🖼️🤖
منبع: arXiv Computer Vision
