محققان در مقاله جدیدی که در arXiv منتشر شده، به بررسی عمیق عملکرد معماریهای مختلف هوش مصنوعی (مثل ترنسفورمرها و مدلهای حالت-فضا یا SSMها) در حل مسئله «Indexing» پرداختهاند.
نتایج این تحقیق نشان میدهد که:
✅ ترنسفورمرهای Softmax در حل این مسئله بسیار سریعتر و کارآمدتر از مدلهای دیگر عمل میکنند.
✅ محدودیتهای ذاتی در یادگیری ترنسفورمرهای خطی (Linear-attention) و مدلهای SSM وجود دارد که با افزایش طول دنباله دادهها، بیشتر خودش را نشان میدهد.
این یافتهها میتواند مسیر طراحی معماریهای بهینهتر و سریعتر برای نسلهای بعدی مدلهای زبانی را تغییر دهد. دنیای زیر پوست هوش مصنوعی هر روز جذابتر از دیروز میشود! 🧠🚀
منبع: arXiv AI
