مدلهای هوش مصنوعی که هم متن میفهمند و هم تصویر، گاهی رفتارهای عجیب و جهتداری از خود نشان میدهند که با تستهای متنی معمولی قابل شناسایی نیست. اما خبر خوب این است که محققان ابزار جدیدی به نام VISTA ساختهاند! 🛠
این ابزار مثل یک «ممیز» عمل کرده و با تحلیل رفتارهای متناقض مدل در برابر تصاویر خاص (مثل نمادها یا ویژگیهای دموگرافیک)، مدلهای مشکوک را شناسایی میکند. جالب اینجاست که در بررسیها مشخص شد برخی مدلها در برابر سوالات مربوط به گروههای خاص، رفتارهای متفاوتی (از پاسخهای تکراری تا امتناع از پاسخ) نشان میدهند.
این روش قدمی مهم برای شفافتر و ایمنتر کردن دنیای هوش مصنوعی چندوجهی است. 🤖✨
منبع: arXiv AI
