محققان در مقاله جدید خود به سراغ یک چالش بزرگ رفتهاند: چطور مدلهای عظیم زبانی (LLMs) که مبتنی بر ترنسفورمر هستند را به مدلهای کوچکتر و سریعتر (xLSTM) تبدیل کنیم که همان قدرت و دقت را داشته باشند؟ 🧠
در این روش جدید، با استفاده از تکنیک «تقطیر» (Distillation) و ترکیب کارشناسان خطیسازی شده، مدلهای سبکتر نه تنها عملکردی نزدیک به مدلهای غولآسا (مثل Llama یا Qwen) دارند، بلکه در برخی وظایف حتی از آنها پیشی میگیرند! این یعنی آیندهای با هوش مصنوعیهای کمهزینهتر و دوستدار انرژی که روی سختافزارهای ضعیفتر هم به راحتی اجرا میشوند. ⚡️
منبع: arXiv Machine Learning
