محققان در مقاله جدیدی از روش نوآورانهای به نام xHC (Expanded Hyper-Connections) رونمایی کردهاند که محدودیتهای مقیاسپذیری در مدلهای ترنسفورمر (Transformer) را هدف قرار داده است.
مدلهای فعلی در استفاده از «هایپر-کانکشنها» معمولاً با محدودیت در تعداد استریمهای پردازشی مواجه بودند، اما xHC با استفاده از یک معماری «توزیعشده و تنک» (Sparse)، اجازه میدهد این مدلها فراتر از محدودیتهای قبلی (N=4) گسترش یابند.
نتیجه این کار چیست؟ مدلهای ۱۸ و ۲۸ میلیارد پارامتری، بدون نیاز به هزینههای پردازشی سنگین، دقت بسیار بیشتری در خروجی نهایی نشان میدهند. این یعنی در آینده شاهد مدلهای هوشمندتر با بهینگی بسیار بالاتر در مصرف منابع سختافزاری خواهیم بود. 🧠⚙️
منبع: arXiv Machine Learning
