محققان در مقالهای تازه، روشی نوآورانه به نام QT-AFT را معرفی کردهاند که مشکل ضعف مدلهای بینایی-زبانی (مثل CLIP) در برابر حملات خصمانه (Adversarial Attacks) را هدف قرار داده است.
این مدل با استفاده از کپشنهای باکیفیت و هدایت معنایی، به جای تکیه صرف بر برچسبهای کوتاه، باعث میشود مدلهای هوش مصنوعی حتی در مواجهه با نویزهای مخرب و تلاشهای هک، خروجیهای دقیقتری ارائه دهند. این دستاورد گام بزرگی برای افزایش پایداری و امنیت مدلهای هوش مصنوعی در محیطهای واقعی است. 💡
منبع: arXiv Computer Vision
