محققان در مطالعهای جدید، روشی نوآورانه برای مدلسازی فضای نهفته در مدلهای CLIP ارائه کردند. برخلاف تصورات قبلی که از توزیعهای گاوسی استفاده میکردند، این مقاله نشان میدهد که فضای CLIP ساختاری «ابرکرهای» (Hyperspherical) دارد.
با استفاده از مدل ترکیبی von Mises-Fisher (MovMF)، حالا میتوان مفاهیم معنایی را در تصاویر و متنها با دقت و تفسیرپذیری بسیار بالاتری مدلسازی کرد. این دستاورد میتواند عملکرد مدلهای چندوجهی را در تشخیص دادههای خارج از توزیع (OOD) به شکل چشمگیری بهبود ببخشد. 🚀
منبع: arXiv Machine Learning
