تا امروز، مدلهای چندوجهی (MLLM) در توصیف محتوای ویدیوها عالی عمل میکردند، اما در پیدا کردنِ «زمان دقیق» وقوع یک اتفاق (Temporal Grounding) ضعف داشتند. حالا «TimeLens2» این چالش را حل کرده است!
ویژگیهای کلیدی این مدل جدید:
✅ شناسایی دقیق بازههای زمانی در ویدیو با هر طول و محتوایی.
✅ استفاده از معماری نوین برای آموزشِ هوشمند و دقیقتر.
✅ عملکرد فوقالعاده: مدلهای TimeLens2 با ابعاد بسیار کوچکتر (۲ تا ۸ میلیارد پارامتر)، توانستهاند مدلهای غولپیکر با ۳۹۷ میلیارد پارامتر را در بنچمارکها شکست دهند!
این یعنی هوش مصنوعی در حال حرکت به سمت مدلهای کوچکتر، بهینهتر و با درک عمیقتر از جریان زمان در ویدیوهاست. 🚀
منبع: arXiv Computer Vision
