🧠 بنچمارک جدید برای سنجش قدرت استدلال هوش مصنوعی: معرفی ClassicLogic

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا هوش مصنوعی واقعاً می‌تواند «فکر» کند و راهکارهای پیچیده را ترکیب کند؟ محققان برای پاسخ به این چالش، بنچمارک جدیدی به نام «ClassicLogic» معرفی کرده‌اند که تمرکز ویژه‌ای بر «تعمیم ترکیبی» (Compositional Generalization) دارد.

این بنچمارک با استفاده از بازی‌های فکری کلاسیک مثل سودوکو، کن‌کن، کاکورو و فوتوشیکی، قدرت استدلال سیستم‌های هوش مصنوعی را در سطوح مختلف به چالش می‌کشد. نوآوری اصلی این پروژه، استفاده از یک پایگاه دانش سلسله‌مراتبی است که به دانشمندان کمک می‌کند بفهمند مدل‌های AI چطور استراتژی‌های ساده را برای حل مسائل پیچیده با هم ترکیب می‌کنند. این یک گام مهم برای توسعه سیستم‌های هوشمند منطقی و نمادین است.

منبع: arXiv AI