🚀 جهش در دقت مدل‌های بینایی-زبانی با روش جدید KALE!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در تازه‌ترین دستاورد خود، تکنیک جدیدی به نام «KALE» را برای بهبود هماهنگی مدل‌های چندوجهی مثل CLIP با مدل‌های بینایی پیشرفته‌ای مانند DINOv2 معرفی کردند.

مشکل اصلی مدل‌های فعلی این است که در مقیاس‌های بزرگ (مثل دیتای وب)، وزن‌های آموزشی به درستی تنظیم نمی‌شوند و عملاً کارایی خود را از دست می‌دهند. روش KALE با استفاده از یک کنترل‌کننده هوشمند، این تراز را به صورت خودکار برقرار می‌کند تا بدون نیاز به تنظیمات دستی پیچیده، شاهد بهبود قابل‌توجه در عملکرد مدل (به‌ویژه در وظایف Zero-shot) باشیم.

این پیشرفت راه را برای مدل‌های دقیق‌تر و پایدارتر در درک تصویر و متن هموارتر می‌کند! 🧠✨

منبع: arXiv Machine Learning