محققان در یک آزمایش جذاب، عملکرد مدلهای زبانی بزرگ (LLM) را در یک آزمایشگاه شیمی رباتیک به چالش کشیدند. نتیجه؟ واقعیت با تئوری تفاوت زیادی دارد! 🤖🔬
در این مطالعه که بیش از ۴۶۰۰ آزمایش انجام شد، تنها ۳.۳ درصد از تلاشها به اجرای موفقیتآمیز در محیط آزمایشگاه منجر شد. این پژوهش نشان میدهد که اگرچه هوش مصنوعی در استدلالهای متنی عالی است، اما در «اجرای فیزیکی» و «برنامهریزی بلندمدت» برای انجام کارهای علمی هنوز راه درازی در پیش دارد.
این تحقیق گامی مهم برای درک نقاط ضعف ایجنتهای خودمختار و بهبود آنها برای کارهای واقعی است. نظرتان چیست؟ آیا هوش مصنوعی به زودی دانشمند رباتیکِ قابلاعتمادی میشود؟
منبع: arXiv AI
