محققان در مقالهای جدید، روشی نوآورانه به نام «پردازش بصری تفکیکشده» (DVP) را معرفی کردهاند که تحولی در آموزش مدلهای زبانی بزرگ چندوجهی (MLLM) ایجاد میکند.
مشکل اصلی مدلهای فعلی، هزینه بسیار بالای تنظیم دقیق (Fine-tuning) تمامی پارامترهاست. تکنیک DVP با جدا کردن مسیر پردازش توکنهای بصری از متنی در لایههای میانی، اجازه میدهد تنها یک بلوک ترنسفورمر سبک برای بخش بصری آموزش ببیند. نتیجه؟ کاهش چشمگیر هزینههای محاسباتی بدون افت کیفیت در بنچمارکهای معتبری مثل LLaVA-1.5!
این یعنی مسیر برای توسعه مدلهای هوشمندتر و ارزانتر هموارتر از همیشه شده است. 🚀
های_چندوجهی
منبع: arXiv AI
