دنیای مدلهای زبانی هر روز پیچیدهتر میشود! محققان بهتازگی معماری نوآورانهای به نام KET معرفی کردهاند که با نگاهی «ریاضیمحور و دستهبندیشده» (Categorical)، مدلهای ترنسفورمر را بازتعریف میکند.
نکات کلیدی این پژوهش:
🔹 ادغام مفهومی: KET به دنبال یکسانسازی مکانیزمهای توجه (Attention)، دیفیوژن و مدلهای پیشبینیکننده است.
🔹 عملکرد بهتر: نتایج آزمایشها روی مجموعهدادههای بزرگی مثل WikiText نشان میدهد که در مدلهای «علّی-سخت» (Strict-causal)، این معماری عملکرد خیرهکنندهای دارد.
🔹 فراتر از همسایگی: این تحقیق نشان میدهد که بهبود کیفیت مدلها نه فقط از طراحیِ ساختار همسایگی، بلکه از اطلاعات «خود-شرطیسازی» (Self-conditioning) ناشی میشود.
این مدل میتواند گام بزرگی در طراحی معماریهای بهینهتر برای هوش مصنوعیهای نسل آینده باشد.
منبع: arXiv Machine Learning
