محققان در یک دستاورد تازه، روشی خلاقانه برای بهبود مکانیزم توجه (Attention) در مدلهای زبانی ابداع کردهاند. مشکل اصلی مدلهای فعلی این است که «دات پروداکت» (Dot Product) به تنهایی نمیتواند تفاوتهای ظریف هندسی و فاصلهها را به خوبی درک کند.
با معرفی «L1 Augmented Attention»، حالا مدلها علاوه بر جهت بردارها، فاصله مختصات را هم در نظر میگیرند که نتیجه آن:
✅ کاهش ۱۴.۵ درصدی نرخ خطا (Perplexity)
✅ درک عمیقتر از هندسه فضای معنایی
✅ کارایی بالاتر در پردازشهای موازی
این تغییر کوچک در ریاضیاتِ پشت پرده مدلهای ترنسفورمر، گامی بزرگ برای رسیدن به دقت بالاتر در مدلهای هوش مصنوعی است. 🤖✨
منبع: arXiv Machine Learning
