مدلهای ترنسفورمر (معماری اصلی ChatGPT و سایر مدلهای بزرگ) مدتی است که دنیای هوش مصنوعی را تسخیر کردهاند، اما حالا برای اولین بار، دانشمندان در یک مقاله جدید موفق شدند به صورت تئوری ثابت کنند که چرا این مدلها تا این حد عالی عمل میکنند!
این تحقیق نشان میدهد که ترنسفورمرهای استاندارد میتوانند توابع پیچیده ریاضی (H”older functions) را با دقت بسیار بالا تقریب بزنند و در محاسبات رگرسیون غیرپارامتریک، به نرخ بهینه دست یابند. به زبان سادهتر، این پژوهش پشتوانه علمی محکمی برای قدرت بینظیر این مدلها فراهم کرده و مسیر را برای درک دقیقتر محدودیتها و توانمندیهای آنها هموارتر میکند. 🔬✨
منبع: arXiv Machine Learning
