🚀 بهینه‌سازی مدل‌های بینایی-زبانی با روش جدید PRiSM

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید، روشی نوآورانه به نام «PRiSM» را معرفی کرده‌اند که چالش بزرگ یادگیری «چند نمونه‌ای» (Few-Shot) را در مدل‌های بینایی-زبانی (VLM) هدف قرار داده است.

🔹 مشکل کجاست؟ مدل‌های فعلی معمولاً فرض می‌کنند داده‌های آموزشی توزیع متوازنی دارند، اما در دنیای واقعی این‌طور نیست و با افزایش داده‌ها، دقت این مدل‌ها به‌شدت افت می‌کند.

🔹 راهکار PRiSM چیست؟ این متد یک لایه «نظم‌دهنده پیش‌نمونه کلاسی» (Class-prototype regularization) است که می‌تواند به صورت یک ماژول جانبی و بسیار سریع روی مدل‌های فعلی نصب شود و دقت آن‌ها را در شرایط غیرمتوازن به‌طور چشمگیری بهبود ببخشد.

این روش نه تنها دقت را بالا می‌برد، بلکه با استفاده از محاسبات بهینه، بار پردازشی سنگینی هم به سیستم تحمیل نمی‌کند. قدمی دیگر برای هوشمندتر شدن درک بصری هوش مصنوعی! 🤖💡

منبع: arXiv Computer Vision