🚀 گامی بزرگ به سوی مدل‌های زبانی بهینه‌تر: جایگزینی برای ترنسفورمرها؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدید خود به سراغ یک چالش بزرگ رفته‌اند: چطور مدل‌های عظیم زبانی (LLMs) که مبتنی بر ترنسفورمر هستند را به مدل‌های کوچک‌تر و سریع‌تر (xLSTM) تبدیل کنیم که همان قدرت و دقت را داشته باشند؟ 🧠

در این روش جدید، با استفاده از تکنیک «تقطیر» (Distillation) و ترکیب کارشناسان خطی‌سازی شده، مدل‌های سبک‌تر نه تنها عملکردی نزدیک به مدل‌های غول‌آسا (مثل Llama یا Qwen) دارند، بلکه در برخی وظایف حتی از آن‌ها پیشی می‌گیرند! این یعنی آینده‌ای با هوش مصنوعی‌های کم‌هزینه‌تر و دوستدار انرژی که روی سخت‌افزارهای ضعیف‌تر هم به راحتی اجرا می‌شوند. ⚡️

منبع: arXiv Machine Learning