محققان در پژوهشی جدید به سراغ تست توانایی مدلهای بینایی-زبانی (VLM) در چالشهای فیزیکی و دقیق مثل «لگو سازی» رفتهاند. آنها با معرفی بنچمارک «LEGO Co-builder»، عملکرد مدلهای قدرتمندی مثل GPT-4o و Gemini را در درک جزئیات بصری و دستورالعملهای مرحلهبهمرحله بررسی کردند.
نتایج جالب و کمی تأملبرانگیز است: در حالی که مدلها در تشخیص اشیاء عملکرد درخشانی دارند، اما در «درک صحنه» و تحلیل وضعیت نهایی قطعات، هنوز با ضعفهای جدی روبهرو هستند. به نظر میرسد فاصله زیادی بین دیدنِ یک قطعه و درکِ نحوه قرارگیری دقیق آن در یک ساختار پیچیده وجود دارد.
این تحقیق نشان میدهد که دنیای ایجنتهای هوش مصنوعی برای تبدیل شدن به دستیارهای فنی و دقیق، هنوز راه زیادی در پیش دارد. 🤖🛠
منبع: arXiv AI
