🚀 بهینه‌سازی مدل‌های بینایی ماشین؛ معرفی روش QATMA برای تشخیص اشیاء با دقت بالا!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دانشمندان راهکار جدیدی به نام QATMA ارائه داده‌اند که به طور خاص برای مدل‌های «تشخیص اشیاء با دایره واژگان باز» (Open-Vocabulary Object Detection) طراحی شده است.

مشکل اصلی مدل‌های فعلی این بود که هنگام فشرده‌سازی (Quantization)، دقت خود را در درک روابط متن و تصویر از دست می‌دادند. حالا QATMA با دو قابلیت نوآورانه:
✅ آموزش مرحله‌بندی شده (Curriculum QAT)
✅ تقطیر شباهت‌های متنی (Text-anchored Distillation)
توانسته بدون افت کیفیت، مدل‌ها را بسیار سبک‌تر و سریع‌تر کند و رکوردهای جدیدی در بنچمارک‌های LVIS و COCO ثبت کند. این یعنی گامی بزرگ برای اجرای مدل‌های بینایی ماشین پیشرفته روی سخت‌افزارهای ضعیف‌تر! 🧠💻

منبع: arXiv Computer Vision