محققان در تازهترین پژوهش خود سراغ یکی از مفاهیم کلیدی یادگیری ماشین به نام «معماریهای پیشبینانه با تعبیه مشترک» (JEPA) رفتهاند. این معماریها که در پردازش تصویر و ویدیو درخشان ظاهر شدهاند، در مواجهه با زبان (Text) با چالشهای عجیبی روبرو میشوند.
نکته اصلی اینجاست: بر خلاف تصاویر که تداوم فضایی دارند، در زبان، یک جای خالی در متن میتواند چندین جایگزین درست داشته باشد. این مقاله توضیح میدهد که چرا تلاش برای فشردهسازی این احتمالات در یک نقطه واحد (Latent Point)، باعث ناپایداری مدل میشود و پیشنهاد میدهد برای پیشرفت باید راهکارهایی را به کار گرفت که چندگانه بودنِ احتمالات زبانی را حفظ کنند.
این یافتهها مسیر تازهای برای توسعه مدلهای زبانی دقیقتر و پایدارتر باز میکند! 🚀
منبع: arXiv NLP


