🧠 بهینه‌سازی خیره‌کننده در مدل‌های چندوجهی؛ معرفی DVP

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید، روشی نوآورانه به نام «پردازش بصری تفکیک‌شده» (DVP) را معرفی کرده‌اند که تحولی در آموزش مدل‌های زبانی بزرگ چندوجهی (MLLM) ایجاد می‌کند.

مشکل اصلی مدل‌های فعلی، هزینه بسیار بالای تنظیم دقیق (Fine-tuning) تمامی پارامترهاست. تکنیک DVP با جدا کردن مسیر پردازش توکن‌های بصری از متنی در لایه‌های میانی، اجازه می‌دهد تنها یک بلوک ترنسفورمر سبک برای بخش بصری آموزش ببیند. نتیجه؟ کاهش چشمگیر هزینه‌های محاسباتی بدون افت کیفیت در بنچمارک‌های معتبری مثل LLaVA-1.5!

این یعنی مسیر برای توسعه مدل‌های هوشمندتر و ارزان‌تر هموارتر از همیشه شده است. 🚀

‌های_چندوجهی

منبع: arXiv AI