آیا مدلهای چندوجهی (MLLM) واقعاً میتوانند تصاویر را درک کنند یا فقط حدس میزنند؟ محققان بهتازگی بنچمارک جامع و جدیدی به نام RefBench-PRO را معرفی کردهاند که فراتر از تستهای معمولی عمل میکند. 🔍
نکته جالب اینجاست که این بنچمارک، توانایی هوش مصنوعی را در ۶ سطح چالشبرانگیز (از تشخیص ویژگیها و موقعیت گرفته تا استدلالهای منطقی و عقل سلیم) ارزیابی میکند. همچنین مدل جدید Ref-R1 با استفاده از تکنیک یادگیری تقویتی (RL) معرفی شده تا دقت مدلها را در شرایط پیچیده بهشدت بالا ببرد. با این ابزار، دیگر ارزیابی هوش مصنوعی در درک محیط فقط یک بازی حدس و گمان نیست! 💡
منبع: arXiv AI
