🚀 معماری جدید برای هوشمندتر کردن ترنسفورمرها: معرفی Dual Attention Residuals (DAR)

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید، معماری خلاقانه «DAR» را معرفی کرده‌اند که نحوه پردازش اطلاعات در مدل‌های ترنسفورمر را ارتقا می‌دهد.

این روش با ایجاد یک ارتباط متقابل (Reciprocal) بین جریان‌های مختلف داده، به مدل اجازه می‌دهد تا در حین بازیابی اطلاعات تاریخی، دقت بسیار بالاتری داشته باشد و از «تنوع عمقی» بهتری برخوردار شود. آزمایش‌ها روی مدل‌های مختلف (از مدل‌های کوچک 0.1 میلیاردی تا مدل‌های بزرگ MoE 7B) نشان می‌دهد که این روش می‌تواند عملکرد مدل را به‌طور محسوسی نسبت به معماری‌های استاندارد بهبود ببخشد.

این یک قدم رو به جلو برای بهینه‌سازی معماری داخلی مدل‌های زبانی بزرگ است! 🧠✨

منبع: arXiv NLP