🧠 تزریق دانش به مدل‌های زبانی: کشف قوانین مقیاس‌پذیری در Hypernetworks!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پژوهش جدید، به سراغ یکی از چالش‌های بزرگ در دنیای LLMها رفته‌اند: چطور می‌توان حجم انبوهی از دانش واقعی را به شکلی مطمئن و مقیاس‌پذیر به مدل‌های هوش مصنوعی تزریق کرد؟ 📚✨

در این مقاله، از «Hypernetworks» برای تزریق دانش در زمان آموزش (Train-time) استفاده شده که برخلاف روش‌های سنتی، مستقیماً آداپتورهای LoRA تولید می‌کند. نکته جذاب اینجاست که تیم پژوهشی با معرفی دیتاسنس بزرگ «MegaWikiQA»، برای اولین بار موفق شدند قوانین مقیاس‌پذیری (Scaling Laws) را برای معماری‌های Hypernetwork تدوین کنند. نتایج نشان می‌دهد که این روش نه تنها قدرت پیش‌بینی بسیار خوبی دارد، بلکه در مواجهه با داده‌های جدید (OOD) نیز عملکرد خیره‌کننده‌ای از خود نشان می‌دهد! 🚀

منبع: arXiv Machine Learning