تولید کد برای رسم نمودارها یکی از چالشهای جذاب دنیای هوش مصنوعی است. مشکل اینجاست که مدلها معمولاً سعی میکنند کدِ دقیقِ منبع را حدس بزنند، اما گاهی دادههای پنهان در نمودارها (مثل نرمالسازی یا فشردهسازی اطلاعات) باعث میشود مدل در بازسازی تصویر دچار خطا شود.
محققان در مقاله جدیدی روشی به نام «Observation-Aligned Supervision» را معرفی کردهاند که به جای تمرکز صرف بر کد، روی ویژگیهای بصری نمودار (مثل نسبت بخشهای نمودار دایرهای یا آمار جعبهای) تمرکز میکند. این تغییر استراتژی باعث شده تا مدلهای بینایی-زبانی (VLM) بتوانند نمودارها را با دقت بسیار بیشتری تحلیل و کدنویسی کنند. قدمی رو به جلو برای دقیقتر کردن ایجنتهای هوشمند در گزارشدهی دادهها! 📉✨
منبع: arXiv Machine Learning
