محققان در تازهترین دستاورد خود، فریمورک «Segment Anything Reasoner» یا به اختصار StAR را معرفی کردهاند. این مدل جدید برخلاف روشهای سنتی، فقط به تشخیص اجسام اکتفا نمیکند، بلکه میتواند با استدلال دقیق، اهداف مورد نظر را در تصاویر پیچیده پیدا کند!
نکات کلیدی این دستاورد:
🔹 افزایش چشمگیر قدرت استدلال در مدلهای بینایی-زبانی.
🔹 اولین استفاده از «مقیاسگذاری در زمانِ تست» (Test-time scaling) در حوزه segmentation.
🔹 معرفی بنچمارک ReasonSeg-X برای سنجش دقیقتر توانایی استدلال مدلها.
این مدل ثابت کرد که حتی با دادههای آموزشی محدود (۵ هزار نمونه)، میتوان تواناییهای نهفته مدلهای بزرگ را بیدار کرد و عملکرد آنها را به شدت ارتقا داد. دنیای بینایی ماشین هر روز دقیقتر میشود! 🚀
منبع: arXiv Computer Vision
