مدلهای چندوجهی (VLM) گاهی اوقات در اثر «فشار» یا پرامپتهای جهتدار، دچار اشتباهات عجیبی میشوند؛ مثلاً اشیاء غیرموجود را تأیید میکنند یا اطلاعات نادرستی میدهند. محققان در پژوهش جدیدی متدولوژی TPCD (Tone-Pressure Contrastive Decoding) را معرفی کردهاند که با استفاده از «خنثیسازی»، این توهمات را به شدت کاهش میدهد.
این روش با تفریق لاجیتهای تولید شده توسط یک پرامپتِ تحت فشار از یک پرامپتِ خنثی، به مدل کمک میکند تا بدون قربانی کردن دقت در پاسخهای صحیح، نرخ خطا را تا حد چشمگیری پایین بیاورد. این دستاورد گامی مهم برای افزایش اعتمادپذیری مدلهای بینایی-زبانی در دنیای واقعی است. ✨
منبع: arXiv Computer Vision
