یکی از بزرگترین چالشهای LLMها، «فروپاشی بازنمایی» است که باعث میشود مدلها در پردازش متنهای طولانی دچار مشکل شوند. محققان با معرفی روش جدید «TRSP» راهکار جذابی برای ایجاد تعادل در پردازش توجه (Attention) ارائه کردهاند.
این معماری که از طریق تنظیم توپولوژیک عمل میکند، بدون تغییر در ساختار اصلی مدل، به آن اجازه میدهد همزمان ظرفیت اطلاعاتی بالا و دقت چشمگیری در پردازش متون طولانی داشته باشد. نتایج آزمایشها نشان میدهد که این روش میتواند دقت مدل را در بنچمارکهای سخت، نسبت به مدلهای فعلی بهطور قابل توجهی افزایش دهد. 🧠✨
منبع: arXiv AI
