محققان به تازگی رویکرد نوآورانهای به نام «HySAT» (آموزش آگاه از ساختار هذلولی) معرفی کردهاند که میتواند مشکل اصلی مدلهای ترنسفورمر سنتی را در درک ساختارهای درختی حل کند. 🌳
در مدلهای فعلی، ساختار درختی دادهها در لایههای عمیق به دلیل ویژگیهای اقلیدسی به مرور کمرنگ میشود. تکنیک جدید HySAT با اعمال هندسه هذلولی در لایههای خروجی (Loss Layer)، موفق شده پایداری آموزش را به شدت افزایش دهد و از شکستهای رایج در آموزش مدلهای تخصصی جلوگیری کند.
این روش که روی مدلهایی مثل Llama 3.1 تست شده، ثابت میکند که مکان قرارگیری هندسه در مدل، یک قانون است و نه یک تنظیم ساده! این پیشرفت میتواند در آینده به ساخت مدلهای زبانی دقیقتر و پایدارتر منجر شود.
های_زبانی
منبع: arXiv AI
