یکی از بزرگترین چالشهای اجرای مدلهای بزرگ بینایی-زبانی (LVLM) روی دستگاههای موبایل و لبه (Edge Devices)، سنگین بودن بیش از حد آنهاست. تا الان بیشتر تمرکزها روی فشردهسازی خودِ مدل زبانی بوده، اما «UltraViT» بازی را تغییر داده است!
محققان در این پژوهش، یک انکودر بصری طراحی کردهاند که مستقیماً برای «تاخیر پایین» در دستگاههای دارای محدودیت سختافزاری بهینه شده است. با معماری هرمی هوشمند و یک استراتژی آموزشی دو مرحلهای (تقطیر ویژگیهای فضایی + نظارت مولد)، UltraViT ثابت کرده که میتوان بدون فدا کردن دقت، سرعت پردازش تصاویر در مدلهای مولد را به شکل چشمگیری افزایش داد. این یعنی آیندهای که در آن مدلهای هوش مصنوعی بینا، روانتر و سریعتر روی گوشیهای ما اجرا میشوند. 🔥
منبع: arXiv Computer Vision
