محققان در مقاله جدید خود به سراغ چالش «تقطیر خودکار» (Self-Distillation) در مدلهای بینایی-زبانی رفتهاند. روش جدید VCSD با حذف نیاز به معلمهای خارجی و تکیه بر «تضاد بصری»، اجازه میدهد مدلهای کوچکتر با کیفیتی بسیار بالاتر آموزش ببینند.
در این روش، مدل با مقایسه پاسخهای مبتنی بر تصویر اصلی و تصویر محو شده، یاد میگیرد که هوشمندانهتر عمل کند. نتایج خیرهکننده روی مدلهای Qwen نشان میدهد که این تکنیک میتواند عملکرد مدلهای سبک را به طرز قابل توجهی بهبود ببخشد و شکاف هوشی بین مدلهای کوچک و بزرگ را پر کند. 🧠✨
های_زبانی
منبع: arXiv AI
