مدتهاست که دنیای مدلهای زبانی تحت سلطه دکودرهای بزرگ بوده و انکودرها (مشابه مدل BERT) تغییرات چندانی نداشتهاند. اما حالا محققان با معرفی معماری جدید «CrossBERT» این سکوت را شکستهاند! 🧠
💡 نکته کلیدی: در مدلهای سنتی، یادگیری بازنمایی متن (Representation) و بازسازی توکنها به هم گره خورده است. CrossBERT با جدا کردن این دو فرآیند، اجازه میدهد مدل با سرعت ۲ برابر بیشتر و کارایی بسیار بالاتر آموزش ببیند.
این معماری جدید با استفاده از استراتژی «ماسکگذاری مکمل»، قدرت یادگیری مدلهای انکودر را برای بنچمارکهای مهمی مثل MTEB به شدت ارتقا داده است. پیشرفتی بزرگ برای کسانی که به دنبال مدلهای کوچکتر و بهینهتر هستند! ⚡️
منبع: arXiv AI
