مدلهای بینایی-زبانی (VLM) معمولاً در تحلیل پزشکی ضعیف عمل میکنند چون بیش از حد روی متن متمرکز هستند. حالا محققان فریمورک جدیدی به نام MedLVR معرفی کردند که با استفاده از «استدلال بصری نهفته» (Latent Visual Reasoning)، به جای تکیه صرف به متن، روی جزئیات دقیق تصاویر پزشکی تمرکز میکند.
این مدل با بازنگری در نحوه پردازش تصاویر و استفاده از تکنیکهای یادگیری تقویتی (VLPO)، توانسته دقت مدلهای قدرتمندی مثل Qwen2.5-VL را بهطور چشمگیری افزایش دهد. این یعنی تشخیصهای دقیقتر و خطاهای کمتر در دنیای پزشکی با کمک هوش مصنوعی! 🏥💡
منبع: arXiv AI
