🚀 هوشمندتر کردن ترنسفورمرها با تکنیک جدید «L1 Augmented Attention»!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک دستاورد تازه، روشی خلاقانه برای بهبود مکانیزم توجه (Attention) در مدل‌های زبانی ابداع کرده‌اند. مشکل اصلی مدل‌های فعلی این است که «دات پروداکت» (Dot Product) به تنهایی نمی‌تواند تفاوت‌های ظریف هندسی و فاصله‌ها را به خوبی درک کند.

با معرفی «L1 Augmented Attention»، حالا مدل‌ها علاوه بر جهت بردارها، فاصله مختصات را هم در نظر می‌گیرند که نتیجه آن:
✅ کاهش ۱۴.۵ درصدی نرخ خطا (Perplexity)
✅ درک عمیق‌تر از هندسه فضای معنایی
✅ کارایی بالاتر در پردازش‌های موازی

این تغییر کوچک در ریاضیاتِ پشت پرده مدل‌های ترنسفورمر، گامی بزرگ برای رسیدن به دقت بالاتر در مدل‌های هوش مصنوعی است. 🤖✨

منبع: arXiv Machine Learning