محققان در یک دستاورد تازه، فریمورک «SD-MAR» را معرفی کردهاند که به مدلهای بینایی-زبانی (VLM) کمک میکند در تحلیلِ همزمانِ چندین تصویر و مقایسه بصری، عملکردی فراتر از انتظار داشته باشند.
ویژگیهای کلیدی این پژوهش:
✅ تمرکز بر وظایف پیچیده مثل تشخیص تغییرات و استدلال گامبهگام بصری.
✅ استفاده از روش نوین «GRPO-lite» برای آموزش مدلها بدون نیاز به پیچیدگیهای رایج (KL regularization).
✅ رکوردشکنی مدل Qwen2.5-VL-7B با این متد، بهطوری که حتی از GPT-4.1 نیز در بنچمارک اختصاصی SD-MAR پیشی گرفته است! 🚀
این یعنی هوش مصنوعی حالا بهتر از قبل میتواند تفاوتهای ظریف بین چند تصویر را درک و تحلیل کند. تحولی که کاربردهای زیادی در رباتیک و سیستمهای نظارتی خواهد داشت.
منبع: arXiv Computer Vision
