محققان در مقالهای جدید، معماری خلاقانه «DAR» را معرفی کردهاند که نحوه پردازش اطلاعات در مدلهای ترنسفورمر را ارتقا میدهد.
این روش با ایجاد یک ارتباط متقابل (Reciprocal) بین جریانهای مختلف داده، به مدل اجازه میدهد تا در حین بازیابی اطلاعات تاریخی، دقت بسیار بالاتری داشته باشد و از «تنوع عمقی» بهتری برخوردار شود. آزمایشها روی مدلهای مختلف (از مدلهای کوچک 0.1 میلیاردی تا مدلهای بزرگ MoE 7B) نشان میدهد که این روش میتواند عملکرد مدل را بهطور محسوسی نسبت به معماریهای استاندارد بهبود ببخشد.
این یک قدم رو به جلو برای بهینهسازی معماری داخلی مدلهای زبانی بزرگ است! 🧠✨
منبع: arXiv NLP
