🚀 فشرده‌سازی هوشمند؛ راهکاری جدید برای درک بهتر ویدیوها توسط هوش مصنوعی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی-تصویری (Video MLLMs) همیشه با یک چالش بزرگ دست‌ و پنجه نرم کرده‌اند: چطور هم جزئیات دقیق بصری را ببینند و هم رویدادهای زمانی سریع را درک کنند؟

محققان در مقاله جدید، متد «Fre-Res» را معرفی کردند که با ترکیب دو تکنیک هوشمندانه، این مشکل را حل می‌کند:

🔹 حفظ لنگرهای فضایی با دقت بالا برای درک جزئیات اشیاء.
🔹 استفاده از فشرده‌سازی مبتنی بر فرکانس برای نمایش تغییرات زمانی با حجم بسیار کمتر.

نتیجه این روش، مدل‌هایی است که با کاهش چشمگیر تعداد توکن‌های بصری، همچنان عملکردی در حد مدل‌های سنگین و پرهزینه دارند! این یعنی پردازش ویدیوهای طولانی در آینده بسیار سریع‌تر و بهینه‌تر خواهد شد. 🎥✨

منبع: arXiv AI