محققان در تازهترین دستاورد خود، تکنیک جدیدی به نام «KALE» را برای بهبود هماهنگی مدلهای چندوجهی مثل CLIP با مدلهای بینایی پیشرفتهای مانند DINOv2 معرفی کردند.
مشکل اصلی مدلهای فعلی این است که در مقیاسهای بزرگ (مثل دیتای وب)، وزنهای آموزشی به درستی تنظیم نمیشوند و عملاً کارایی خود را از دست میدهند. روش KALE با استفاده از یک کنترلکننده هوشمند، این تراز را به صورت خودکار برقرار میکند تا بدون نیاز به تنظیمات دستی پیچیده، شاهد بهبود قابلتوجه در عملکرد مدل (بهویژه در وظایف Zero-shot) باشیم.
این پیشرفت راه را برای مدلهای دقیقتر و پایدارتر در درک تصویر و متن هموارتر میکند! 🧠✨
منبع: arXiv Machine Learning
