محققان در مقالهای جدید، روشی نوآورانه به نام «PRiSM» را معرفی کردهاند که چالش بزرگ یادگیری «چند نمونهای» (Few-Shot) را در مدلهای بینایی-زبانی (VLM) هدف قرار داده است.
🔹 مشکل کجاست؟ مدلهای فعلی معمولاً فرض میکنند دادههای آموزشی توزیع متوازنی دارند، اما در دنیای واقعی اینطور نیست و با افزایش دادهها، دقت این مدلها بهشدت افت میکند.
🔹 راهکار PRiSM چیست؟ این متد یک لایه «نظمدهنده پیشنمونه کلاسی» (Class-prototype regularization) است که میتواند به صورت یک ماژول جانبی و بسیار سریع روی مدلهای فعلی نصب شود و دقت آنها را در شرایط غیرمتوازن بهطور چشمگیری بهبود ببخشد.
این روش نه تنها دقت را بالا میبرد، بلکه با استفاده از محاسبات بهینه، بار پردازشی سنگینی هم به سیستم تحمیل نمیکند. قدمی دیگر برای هوشمندتر شدن درک بصری هوش مصنوعی! 🤖💡
منبع: arXiv Computer Vision
