💡 چرا مدل‌های هوش مصنوعی در متن‌های طولانی دچار «هذیان» و ناپایداری می‌شوند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهش جدید خود به کشف جالبی درباره ترنسفورمرها رسیده‌اند! آن‌ها متوجه شدند که وقتی مدل‌ها سعی می‌کنند متن‌های بسیار طولانی را پردازش کنند، «وابستگی‌های محلی متراکم» باعث ایجاد پدیده‌ای به نام «انفجار لاجیت‌ها» (Attention-Logit Explosion) می‌شود.

این مشکل نه تنها باعث ناپایداری در آموزش مدل می‌شود، بلکه به‌ویژه در محاسبات با دقت پایین (Low-precision)، کیفیت خروجی را به‌شدت کاهش می‌دهد. این مقاله پیشنهاد می‌دهد که با مدل‌سازی دقیق‌تر این وابستگی‌های محلی، می‌توانیم معماری‌های آینده را برای متن‌های طولانی بسیار پایدارتر و کارآمدتر کنیم. خبر خوبی برای توسعه‌دهندگان مدل‌های زبانی بزرگ که به دنبال کانتکست‌های طولانی‌تر هستند! 🚀

منبع: arXiv Machine Learning