مدلهای زبانی چندوجهی (MLLM) معمولاً با یک چالش بزرگ دست و پنجه نرم میکنند: وقتی اطلاعات جدید یاد میگیرند، دانش قبلیشان درباره تصاویر (به دلیل جابهجایی توزیع بصری) پاک میشود که به آن «فراموشی فاجعهبار» میگویند.
محققان با معرفی چارچوب PMA (Progressive Multimodal Alignment) راهکاری ارائه دادند که به مدل اجازه میدهد بدون پاک شدن دانش قبلی، به صورت مستمر آموزش ببیند. این روش با استفاده از یک سیستم «متخصصمحور» و منعطف، تعادلی هوشمندانه بین پایداری و یادگیری برقرار میکند که باعث بهبود عملکرد خیرهکننده در مدلهای چندوجهی میشود.
اگر در حوزه توسعه مدلهای بینایی-زبانی فعالیت میکنید، این مقاله علمی جدید از arXiv میتواند برایتان بسیار کاربردی باشد! 🚀
منبع: arXiv AI
