محققان به تازگی از یک چارچوب نوآورانه به نام Trace رونمایی کردهاند که تحولی در آموزش مدلهای بینایی-زبانی (Vision-Language Models) ایجاد کرده است.
تا پیش از این، مدلهای هوش مصنوعی در استدلالهای بصری چند دامنهای با کمبود دادههای قابلاعتماد و بازتولیدپذیر مواجه بودند. سیستم Trace با استفاده از «گرامر صحنه» و «برنامههای اجرایی»، محیطی دقیق برای آموزش مدلها فراهم کرده که باعث شده قدرت استدلال مدلهایی مثل Qwen2.5-VL تا ۴ درصد در بنچمارکهای خارجی بهبود یابد.
این یعنی هوش مصنوعی در درک تصاویر و پاسخ به سوالات پیچیده، هر روز باهوشتر و دقیقتر میشود! 🚀
منبع: arXiv Computer Vision
