محققان در مطالعه جدید خود از فریمورک نوآورانه H-OPD رونمایی کردهاند که تحولی در روشهای «تقطیر سیاستی» (On-policy Distillation) ایجاد میکند.
مشکل روشهای قبلی این بود که در مدلهای چندوجهی، فقط از یک «معلم» برای یادگیری استفاده میکردند؛ اما H-OPD با استفاده از چندین معلم مختلف (متنی و بینایی) و یک سیستم داوری دقیق در سطح هر توکن، اجازه میدهد مدل دانشهای متفاوت را به بهترین شکل ترکیب کند. این یعنی دقت بسیار بالاتر در استدلالهای پیچیده چندوجهی!
نتایج این تحقیق روی ۱۱ بنچمارک معتبر، کارایی بالای این متد را ثابت کرده است. گامی دیگر به سوی مدلهای هوشمندتر که درک عمیقتری از دنیای پیرامون دارند. 🚀
منبع: arXiv Computer Vision
