محققان در تازهترین دستاورد خود در زمینه مدلهای زبانی چندوجهی (MLLMs)، راهکار نوآورانهای به نام TRAG را معرفی کردهاند که فرآیند «تقطیر دانش» (Knowledge Distillation) را به سطح جدیدی برده است. 📉
مشکل روشهای فعلی این بود که مدلهای کوچکتر (دانشآموز) در تقلید از مدلهای بزرگتر (معلم) چندان دقیق عمل نمیکردند. تکنیک TRAG با تمرکز بر توجه «پاسخ به تصویر» (Response-to-visual) به جای توجه «پرسش به تصویر»، به مدل یاد میدهد که با دقت بسیار بیشتری بر جزئیات بصری تمرکز کند.
این روش با وزندهی هوشمندانه به توکنها، باعث میشود مدلهای سبکتر، عملکردی به مراتب هوشمندتر و دقیقتر داشته باشند. گامی بزرگ برای رسیدن به هوش مصنوعی قدرتمند در دستگاههای سبکتر! 🚀
منبع: arXiv Computer Vision
