🎥 تحولی در درک ویدیو توسط هوش مصنوعی: معرفی TimeLens2!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا امروز، مدل‌های چندوجهی (MLLM) در توصیف محتوای ویدیوها عالی عمل می‌کردند، اما در پیدا کردنِ «زمان دقیق» وقوع یک اتفاق (Temporal Grounding) ضعف داشتند. حالا «TimeLens2» این چالش را حل کرده است!

ویژگی‌های کلیدی این مدل جدید:
✅ شناسایی دقیق بازه‌های زمانی در ویدیو با هر طول و محتوایی.
✅ استفاده از معماری نوین برای آموزشِ هوشمند و دقیق‌تر.
✅ عملکرد فوق‌العاده: مدل‌های TimeLens2 با ابعاد بسیار کوچک‌تر (۲ تا ۸ میلیارد پارامتر)، توانسته‌اند مدل‌های غول‌پیکر با ۳۹۷ میلیارد پارامتر را در بنچمارک‌ها شکست دهند!

این یعنی هوش مصنوعی در حال حرکت به سمت مدل‌های کوچک‌تر، بهینه‌تر و با درک عمیق‌تر از جریان زمان در ویدیوهاست. 🚀

منبع: arXiv Computer Vision