دنیای مدلهای چندوجهی (Omni-modal) که بتوانند همزمان متن، تصویر، صدا و ویدیو را بفهمند، با معرفی مدل جدید Conan-embedding-v3 یک گام بزرگ رو به جلو برداشت. محققان با استفاده از یک استراتژی هوشمندانه به نام «ادغام متخصصان» (Decoupled Specialist Fusion)، موفق شدند مدلهای تخصصی در حوزههای مختلف را در یک ساختار واحد ترکیب کنند.
نکته جالب اینجاست که آنها با شناسایی یک مشکل فنی به نام «رانش پروژکتور» (Projector Drift)، راهکاری برای بازسازی و بهبود عملکرد مدل در بخشهای صوتی پیدا کردهاند که دقت نهایی مدل را به شکل چشمگیری افزایش داده است. این یعنی سیستمهای جستجوی هوشمند در آینده، درک بسیار دقیقتری از محتواهای ترکیبی خواهند داشت! 🧠🔗
منبع: arXiv Machine Learning
