مدلهای SSM یا همان State-Space Models (مثل Mamba) به دلیل قدرت فوقالعادهشان در پردازش توالیهای طولانی، حسابی سر و صدا کردهاند. اما یک مشکل فنی بزرگ در آنها وجود داشت: «پایداری». به دلیل نحوه کارکرد این مدلها و سیگنالهای گیتینگ، درک دقیق پایداری آنها همیشه چالشبرانگیز بود.
در پژوهشی جدید، محققان با استفاده از تئوری کنترل، ابزارهای ریاضی دقیقی را معرفی کردهاند که به پایداری این مدلها کمک میکند. آنها یک روش آموزشمحور (Regularizer) ارائه دادند که خطاهای پایداری در هسته Mamba را تا ۹۲٪ کاهش میدهد، بدون اینکه دقت مدل در کارهای عملی آسیب ببیند. یک گام فنی مهم برای مدلهایی که میخواهند جای ترنسفورمرها را بگیرند!
منبع: arXiv Machine Learning
