مدلهای چندوجهی (MLLM) قدرت فوقالعادهای دارند، اما هزینه محاسباتی بالای آنها همیشه یکی از چالشهای اصلی برای استفادههای کاربردی بوده است.
محققان در مقاله جدیدی، چارچوب نوآورانه SmartVL را معرفی کردهاند که با یک رویکرد هوشمندانه، به صورت همزمان «تعداد توکنهای بصری» و «میزان توان محاسباتی مدل» را بر اساس بودجه در دسترس و محتوای ورودی مدیریت میکند. این یعنی مدل در لحظه تصمیم میگیرد برای هر ورودی چقدر پردازش انجام دهد تا هم دقت حفظ شود و هم سرعت بهینه بماند.
این پیشرفت میتواند راه را برای اجرای مدلهای قدرتمندتر روی سختافزارهای محدودتر هموارتر کند.
منبع: arXiv Computer Vision
