🚀 فشرده‌سازی هوشمندانه: کاهش ۵۴ درصدی توکن‌های ورودی در مدل‌های چندوجهی! 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی از فریم‌ورک نوآورانه «ReMo» رونمایی کردند که هدفش حل مشکل هزینه‌های بالای پردازش در مدل‌های Omni-LLM است. همان‌طور که می‌دانید، ورودی‌های ویدیویی معمولاً حجم بسیار زیادی از توکن‌های تکراری را اشغال می‌کنند.

فریم‌ورک ReMo بدون نیاز به آموزش مجدد، با حذف اطلاعات تکراری و تبدیل اشیاء ویدیویی به توصیفات متنی فشرده، توانسته ۵۴٪ از توکن‌های ورودی را حذف کند! جالب‌تر اینکه این مدل نه تنها افت دقتی نداشته، بلکه در بنچمارک‌های صوتی-تصویری عملکرد بهتری نسبت به مدل‌های کامل نشان داده است. این یعنی آینده هوش مصنوعی چندوجهی، سریع‌تر و به‌صرفه‌تر از همیشه خواهد بود. ✨

منبع: arXiv Computer Vision