محققان در یک نوآوری جذاب، روشی به نام «VISOR++» معرفی کردهاند که اجازه میدهد رفتار مدلهای بینایی-زبانی (VLM) را بدون نیاز به دسترسی به تنظیمات داخلی یا کدهای منبع آنها، تنها با استفاده از یک تصویر بهینهشده کنترل کنید! 🖼️
در روشهای قبلی، برای تغییر رفتار مدل باید مستقیماً وارد تنظیمات فنی آن میشدیم که در مدلهای تجاری و بسته غیرممکن بود. اما VISOR++ با استفاده از «ورودیهای بصری جهانی»، میتواند دستورات هدف (مثل امتناع از پاسخدهی یا تغییر لحن مدل) را به مدل دیکته کند. این یک قدم بزرگ برای افزایش امنیت و بهینهسازی مدلهای هوش مصنوعی بدون دردسرهای فنی است. 🚀
منبع: arXiv AI
