تحقیقات جدیدی که به تازگی در arXiv منتشر شده، چالش جالبی را برای مدلهای بینایی-زبانی (VLM) مطرح کرده است. نتایج نشان میدهد که مدلهای قدرتمندی مثل GPT-5.4 و مدلهای متنباز دیگر، در تحلیل نمودارهای UML بیشتر از اینکه واقعاً «ببینند»، به دانش پیشفرض و احتمالات خود تکیه میکنند.
محققان با طراحی یک بنچمارک هوشمند، متوجه شدند که تغییر جهت یک فلش در نمودار، دقت پاسخدهی این مدلها را به شدت کاهش میدهد (تا ۴۵ درصد!). این یعنی هوش مصنوعی در درک ساختارهای مهندسی نرمافزار هنوز راه زیادی تا رسیدن به «فهم واقعی» دارد. این یافته برای توسعهدهندگانی که از AI برای تحلیل نقشههای فنی کمک میگیرند، یک هشدار جدی است. 🧠💻
منبع: arXiv Computer Vision
