دانشمندان راهکار جدیدی به نام QATMA ارائه دادهاند که به طور خاص برای مدلهای «تشخیص اشیاء با دایره واژگان باز» (Open-Vocabulary Object Detection) طراحی شده است.
مشکل اصلی مدلهای فعلی این بود که هنگام فشردهسازی (Quantization)، دقت خود را در درک روابط متن و تصویر از دست میدادند. حالا QATMA با دو قابلیت نوآورانه:
✅ آموزش مرحلهبندی شده (Curriculum QAT)
✅ تقطیر شباهتهای متنی (Text-anchored Distillation)
توانسته بدون افت کیفیت، مدلها را بسیار سبکتر و سریعتر کند و رکوردهای جدیدی در بنچمارکهای LVIS و COCO ثبت کند. این یعنی گامی بزرگ برای اجرای مدلهای بینایی ماشین پیشرفته روی سختافزارهای ضعیفتر! 🧠💻
منبع: arXiv Computer Vision
