مدلهای چندوجهی (MLLM) در درک فضای سهبعدی هنوز با چالشهایی روبرو هستند. محققان به تازگی فریمورک جدیدی به نام ViPS معرفی کردهاند که میتواند با ترکیب چندین «پیشفرض بصری» (Visual Priors) از مدلهای مختلف، درک فضایی این مدلها را به شکل چشمگیری بهبود ببخشد.
ویژگی کلیدی ViPS، استفاده از یک مکانیسم «فیوژن پویا» است که به مدل اجازه میدهد بهصورت هوشمندانه و با کمترین هزینه محاسباتی، بهترین اطلاعات را از مدلهای مختلف استخراج و ترکیب کند. این دستاورد، رکوردهای جدیدی را در بنچمارکهای استدلال فضایی به نام خود ثبت کرده است. 🤖✨
منبع: arXiv Computer Vision
