🚀 خداحافظی با کندی در مدل‌های بزرگ؛ لینیرسازی ترنسفورمرها بهینه‌تر شد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، راهکاری برای حل مشکل «هزینه پردازشی» ترنسفورمرها در متون طولانی ارائه داده‌اند. مدل‌های قدرتمندی مثل LLaMA و Qwen که معمولاً به دلیل مکانیزم Self-attention در پردازش متن‌های خیلی بلند کند می‌شوند، حالا با این روش جدید که «لینیرسازی» نام دارد، بسیار سریع‌تر و بهینه‌تر عمل می‌کنند.

این تیم با استفاده از تکنیک‌هایی مثل «Sink Tokens» و مدیریت هوشمند حافظه (Cache Routing)، توانسته‌اند بدون افت کیفیت و دقت، مدل‌های ۳۲ میلیارد پارامتری را به شکلی متحول کنند که در مقایسه با روش‌های قبلی، عملکرد بسیار درخشان‌تری داشته باشند. گامی بزرگ برای رسیدن به هوش مصنوعی‌های سریع‌تر و در دسترس‌تر! 🤖⚡️

منبع: arXiv Machine Learning