محققان در یک پژوهش جدید، بنچمارک جذابی به نام «AlloBench» را معرفی کردهاند تا بسنجند آیا مدلهای زبانی بزرگ (مثل GPT-5.6 و Claude) میتوانند در مواجهه با بودجه محدود، ابزارهای بهینه و قابل استفاده مجدد بسازند یا خیر. 🤔
نتایج جالب است: مدلهای پیشرو در مسائل انتزاعی و تئوری عالی عمل میکنند، اما وقتی پای نوشتن کدهای واقعی وسط میآید، در «بهینهسازی منابع» دچار چالش میشوند. این تحقیق نشان میدهد که هنوز مرزهای توانمندی مدلها در مدیریت ابزارها (Tool Allocation) جای کار بسیاری دارد. 🛠️✨
منبع: arXiv Machine Learning
