محققان در یک پژوهش جدید، به سراغ یکی از چالشهای بزرگ در دنیای LLMها رفتهاند: چطور میتوان حجم انبوهی از دانش واقعی را به شکلی مطمئن و مقیاسپذیر به مدلهای هوش مصنوعی تزریق کرد؟ 📚✨
در این مقاله، از «Hypernetworks» برای تزریق دانش در زمان آموزش (Train-time) استفاده شده که برخلاف روشهای سنتی، مستقیماً آداپتورهای LoRA تولید میکند. نکته جذاب اینجاست که تیم پژوهشی با معرفی دیتاسنس بزرگ «MegaWikiQA»، برای اولین بار موفق شدند قوانین مقیاسپذیری (Scaling Laws) را برای معماریهای Hypernetwork تدوین کنند. نتایج نشان میدهد که این روش نه تنها قدرت پیشبینی بسیار خوبی دارد، بلکه در مواجهه با دادههای جدید (OOD) نیز عملکرد خیرهکنندهای از خود نشان میدهد! 🚀
منبع: arXiv Machine Learning
