🧠 بهینه‌سازی دقیق‌تر مدل‌های چندوجهی (MLLM) با هنرِ «هرس کردن» توکن‌های تصویری!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دانشمندان هوش مصنوعی در پژوهشی جدید بررسی کردند که چگونه «هرس کردن» (Pruning) توکن‌های تصویری برای کاهش هزینه‌های پردازش، بر دقت و اطمینان (Calibration) مدل‌های چندوجهی تاثیر می‌گذارد.

نکته کلیدی این تحقیق این است که صرفاً حذف توکن‌ها کافی نیست و روش انتخاب آن‌ها نقش حیاتی در کاهش خطای مدل دارد. محققان نشان دادند که با انتخاب صحیح توکن‌ها، می‌توان بدون افت دقت، مدل‌ها را بهینه کرد و از «بیش‌اطمینانی» (Overconfidence) کاذب آن‌ها جلوگیری کرد. این دستاورد می‌تواند گامی مهم برای اجرای سریع‌تر و دقیق‌تر مدل‌های بینایی-زبانی روی دستگاه‌های محدود باشد. 🚀

منبع: arXiv Computer Vision