محققان در یک پژوهش جدید، چالش جالبی را در مدلهای زبانی کشف کردهاند. آنها متوجه شدند که روش استاندارد «تقطیر دانش» در بیش از نیمی از موارد، نه تنها به بهبود مدل کمک نمیکند، بلکه باعث کاهش دقت آن در خلاصهسازی زبانهای کممنابع میشود!
💡 راهکار نوآورانه تیم تحقیق، معرفی متدهای «CHAD» و «EWAD+CPDP» است که با درک دقیقتر از عملکرد مدل معلم، جلوی این خطاهای مخرب را میگیرند. نتیجه؟ مدلی با تنها ۶۰ میلیون پارامتر که از مدلهای غولپیکر ۳ میلیارد پارامتری هم پیشی میگیرد! این دستاورد گام بزرگی برای ساخت مدلهای سبک، کارآمد و هوشمندتر برای زبانهای مختلف است. 🌍✨
منبع: arXiv NLP
