🚀 آینده معماری ترنسفورمرها؛ معرفی Kan Extension Transformers (KETs)

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دنیای مدل‌های زبانی هر روز پیچیده‌تر می‌شود! محققان به‌تازگی معماری نوآورانه‌ای به نام KET معرفی کرده‌اند که با نگاهی «ریاضی‌محور و دسته‌بندی‌شده» (Categorical)، مدل‌های ترنسفورمر را بازتعریف می‌کند.

نکات کلیدی این پژوهش:
🔹 ادغام مفهومی: KET به دنبال یکسان‌سازی مکانیزم‌های توجه (Attention)، دیفیوژن و مدل‌های پیش‌بینی‌کننده است.
🔹 عملکرد بهتر: نتایج آزمایش‌ها روی مجموعه‌داده‌های بزرگی مثل WikiText نشان می‌دهد که در مدل‌های «علّی-سخت» (Strict-causal)، این معماری عملکرد خیره‌کننده‌ای دارد.
🔹 فراتر از همسایگی: این تحقیق نشان می‌دهد که بهبود کیفیت مدل‌ها نه فقط از طراحیِ ساختار همسایگی، بلکه از اطلاعات «خود-شرطی‌سازی» (Self-conditioning) ناشی می‌شود.

این مدل می‌تواند گام بزرگی در طراحی معماری‌های بهینه‌تر برای هوش مصنوعی‌های نسل آینده باشد.

منبع: arXiv Machine Learning