محققان در مقاله جدیدی از فریمورک نوآورانه «ReMo» رونمایی کردند که هدفش حل مشکل هزینههای بالای پردازش در مدلهای Omni-LLM است. همانطور که میدانید، ورودیهای ویدیویی معمولاً حجم بسیار زیادی از توکنهای تکراری را اشغال میکنند.
فریمورک ReMo بدون نیاز به آموزش مجدد، با حذف اطلاعات تکراری و تبدیل اشیاء ویدیویی به توصیفات متنی فشرده، توانسته ۵۴٪ از توکنهای ورودی را حذف کند! جالبتر اینکه این مدل نه تنها افت دقتی نداشته، بلکه در بنچمارکهای صوتی-تصویری عملکرد بهتری نسبت به مدلهای کامل نشان داده است. این یعنی آینده هوش مصنوعی چندوجهی، سریعتر و بهصرفهتر از همیشه خواهد بود. ✨
منبع: arXiv Computer Vision
