🤖 آیا مدل‌های هوش مصنوعی واقعاً در استفاده از ابزارها «هوشمند» عمل می‌کنند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پژوهش جدید، بنچمارک جذابی به نام «AlloBench» را معرفی کرده‌اند تا بسنجند آیا مدل‌های زبانی بزرگ (مثل GPT-5.6 و Claude) می‌توانند در مواجهه با بودجه محدود، ابزارهای بهینه و قابل استفاده مجدد بسازند یا خیر. 🤔

نتایج جالب است: مدل‌های پیشرو در مسائل انتزاعی و تئوری عالی عمل می‌کنند، اما وقتی پای نوشتن کدهای واقعی وسط می‌آید، در «بهینه‌سازی منابع» دچار چالش می‌شوند. این تحقیق نشان می‌دهد که هنوز مرزهای توانمندی مدل‌ها در مدیریت ابزارها (Tool Allocation) جای کار بسیاری دارد. 🛠️✨

منبع: arXiv Machine Learning