محققان در یک تحقیق جدید، روش خلاقانهای به نام NOPD (Noisy Student On-Policy Self-Distillation) معرفی کردهاند که به مدلهای بینایی-زبانی (VLM) اجازه میدهد بدون نیاز به دادههای برچسبگذاریشده توسط انسان یا مدلهای خارجی، خودشان را بهبود ببخشند! 🧠✨
این روش با استفاده از ایجاد تفاوت بین ورودیهای «تمیز» و «نویزی»، نوعی خود-نظارتی ایجاد میکند. نتایج شگفتانگیز است؛ این تکنیک روی مدل Qwen2.5-VL-7B توانسته در آزمونهای استدلالی تا ۲۰ امتیاز بهبود ایجاد کند و حتی در برخی بنچمارکها از روشهای پیچیده یادگیری تقویتی پیشی بگیرد.
این یعنی هوش مصنوعی در مسیر یادگیری مستقل، گام بزرگی رو به جلو برداشته است! 🔥
منبع: arXiv Machine Learning
