🚀 وقتی تقطیر دانش (Knowledge Distillation) به جای بهبود، به مدل آسیب می‌زند! 📉

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پژوهش جدید، چالش جالبی را در مدل‌های زبانی کشف کرده‌اند. آن‌ها متوجه شدند که روش استاندارد «تقطیر دانش» در بیش از نیمی از موارد، نه تنها به بهبود مدل کمک نمی‌کند، بلکه باعث کاهش دقت آن در خلاصه‌سازی زبان‌های کم‌منابع می‌شود!

💡 راهکار نوآورانه تیم تحقیق، معرفی متدهای «CHAD» و «EWAD+CPDP» است که با درک دقیق‌تر از عملکرد مدل معلم، جلوی این خطاهای مخرب را می‌گیرند. نتیجه؟ مدلی با تنها ۶۰ میلیون پارامتر که از مدل‌های غول‌پیکر ۳ میلیارد پارامتری هم پیشی می‌گیرد! این دستاورد گام بزرگی برای ساخت مدل‌های سبک، کارآمد و هوشمندتر برای زبان‌های مختلف است. 🌍✨

منبع: arXiv NLP