🔍 کدینگ ایجنت‌ها و معماهای ARC-AGI؛ آیا «مدل‌های دنیای قابل اجرا» واقعاً کلید حل مسائل هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در جدیدترین پژوهش خود به سراغ ارزیابی عملکرد عامل‌های هوشمند (AI Agents) در حل بنچمارک چالش‌برانگیز ARC-AGI-3 رفته‌اند. این مطالعه به دنبال پاسخ به یک سوال کلیدی است: آیا ترکیب «مدل‌های دنیای قابل اجرا» (Executable World Models)، ساده‌سازی مراحل و تایید دقیق خروجی، واقعاً کارایی ایجنت‌ها را افزایش می‌دهد یا خیر؟

نتایج جالبی از این بررسی به دست آمده:
✅ هرچه مدل قدرتمندتر و زمان استدلال (Reasoning Effort) بیشتر باشد، ایجنت‌ها عملکرد بهتری دارند.
✅ استفاده از «مدل دنیای قابل اجرا» همیشه نتیجه بهتری نسبت به روش‌های متنی ندارد.
✅ «تایید دقیق» (Verification) همچنان در اکثر تنظیمات، برگ برنده ایجنت‌ها برای رسیدن به دقت بالاتر است.

این تحقیق نشان می‌دهد که برای توسعه ایجنت‌های پیشرفته، باید رویکردهای ترکیبی را با دقت بیشتری انتخاب کنیم.

منبع: arXiv AI