🧠 پایان توهمات مدل‌های بصری با تکنیک جدید TPCD

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های چندوجهی (VLM) گاهی اوقات در اثر «فشار» یا پرامپت‌های جهت‌دار، دچار اشتباهات عجیبی می‌شوند؛ مثلاً اشیاء غیرموجود را تأیید می‌کنند یا اطلاعات نادرستی می‌دهند. محققان در پژوهش جدیدی متدولوژی TPCD (Tone-Pressure Contrastive Decoding) را معرفی کرده‌اند که با استفاده از «خنثی‌سازی»، این توهمات را به شدت کاهش می‌دهد.

این روش با تفریق لاجیت‌های تولید شده توسط یک پرامپتِ تحت فشار از یک پرامپتِ خنثی، به مدل کمک می‌کند تا بدون قربانی کردن دقت در پاسخ‌های صحیح، نرخ خطا را تا حد چشمگیری پایین بیاورد. این دستاورد گامی مهم برای افزایش اعتمادپذیری مدل‌های بینایی-زبانی در دنیای واقعی است. ✨

منبع: arXiv Computer Vision