محققان در جدیدترین پژوهش خود به سراغ ارزیابی عملکرد عاملهای هوشمند (AI Agents) در حل بنچمارک چالشبرانگیز ARC-AGI-3 رفتهاند. این مطالعه به دنبال پاسخ به یک سوال کلیدی است: آیا ترکیب «مدلهای دنیای قابل اجرا» (Executable World Models)، سادهسازی مراحل و تایید دقیق خروجی، واقعاً کارایی ایجنتها را افزایش میدهد یا خیر؟
نتایج جالبی از این بررسی به دست آمده:
✅ هرچه مدل قدرتمندتر و زمان استدلال (Reasoning Effort) بیشتر باشد، ایجنتها عملکرد بهتری دارند.
✅ استفاده از «مدل دنیای قابل اجرا» همیشه نتیجه بهتری نسبت به روشهای متنی ندارد.
✅ «تایید دقیق» (Verification) همچنان در اکثر تنظیمات، برگ برنده ایجنتها برای رسیدن به دقت بالاتر است.
این تحقیق نشان میدهد که برای توسعه ایجنتهای پیشرفته، باید رویکردهای ترکیبی را با دقت بیشتری انتخاب کنیم.
منبع: arXiv AI
