یکی از چالشهای بزرگ در دنیای مدلهای زبانی-تصویری، «فراموشی فاجعهبار» (Catastrophic Forgetting) است؛ یعنی وقتی مدل یاد میگیرد کار جدیدی انجام دهد، دانش قبلیاش را از دست میدهد! 📉
محققان در مقاله جدیدی ضمن معرفی بنچمارک MRCL، روشی به نام CPO (Continual Policy Optimization) را ارائه کردهاند. این روش بدون نیاز به بازپخش دادههای قدیمی، به مدل کمک میکند تا بدون افت کیفیت، همزمان با یادگیریِ وظایف جدید، توانمندیهای قبلی خود را نیز حفظ کند.
نتایج روی مدل Qwen3-VL-8B خیرهکننده بوده و توانسته فراموشی را تا ۱۳.۷٪ کاهش و عملکرد مدل را ۷٪ بهبود دهد. این گامی بزرگ برای هوشمندتر و پایدارتر کردن مدلهای مولتیمودال است. 🚀
منبع: arXiv Machine Learning
