🚀 استاندارد جدید برای سنجش قدرت بینایی و استدلال هوش مصنوعی: معرفی RefBench-PRO 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا مدل‌های چندوجهی (MLLM) واقعاً می‌توانند تصاویر را درک کنند یا فقط حدس می‌زنند؟ محققان به‌تازگی بنچمارک جامع و جدیدی به نام RefBench-PRO را معرفی کرده‌اند که فراتر از تست‌های معمولی عمل می‌کند. 🔍

نکته جالب اینجاست که این بنچمارک، توانایی هوش مصنوعی را در ۶ سطح چالش‌برانگیز (از تشخیص ویژگی‌ها و موقعیت گرفته تا استدلال‌های منطقی و عقل سلیم) ارزیابی می‌کند. همچنین مدل جدید Ref-R1 با استفاده از تکنیک یادگیری تقویتی (RL) معرفی شده تا دقت مدل‌ها را در شرایط پیچیده به‌شدت بالا ببرد. با این ابزار، دیگر ارزیابی هوش مصنوعی در درک محیط فقط یک بازی حدس‌ و گمان نیست! 💡

منبع: arXiv AI