🔍 چرا مدل‌های هوش مصنوعی در درک «طول متن» متفاوت عمل می‌کنند؟ 🤖✨

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی به یک تفاوت کلیدی در معماری ترنسفورمرها پی برده‌اند: چرا مدل‌هایی که از «کدگذاری نسبی» (Relative Positional Encoding) استفاده می‌کنند، در پردازش متون طولانی‌تر از داده‌های آموزشی بهتر عمل می‌کنند؟

این تحقیق نشان می‌دهد که برخلاف تصور قبلی، دلیل این برتری صرفاً «ظرفیت مدل» نیست، بلکه به نحوه بهینه‌سازی و «سوگیری ضمنی» (Implicit Bias) مدل در یادگیری بستگی دارد. به زبان ساده، روش‌های مبتنی بر چرخش (Rotary Encodings) به مدل کمک می‌کنند تا روابط بین کلمات را بدون توجه به جایگاه مطلق آن‌ها درک کند و این باعث می‌شود در متن‌های طولانی «حافظه» خود را از دست ندهد.

دانستن این جزئیات فنی برای درک بهتر محدودیت‌های مدل‌های زبانی فعلی و بهبود عملکرد آن‌ها در آینده بسیار حیاتی است. 🧠🚀

منبع: arXiv Machine Learning