محققان در تازهترین پژوهش خود، مدل جدیدی به نام «TimePLE» را معرفی کردهاند که انقلابی در زمینه «زمینیسازی زمانی ویدیو» (Video Temporal Grounding) ایجاد میکند.
تا امروز، مدلهای بینایی-زبانی (VLM) برای پیدا کردن یک بازه زمانی در ویدیو، از روشهای غیرمستقیم و نقطهای استفاده میکردند که اغلب دقت کافی نداشت. TimePLE با رویکردی نوآورانه، بهجای پیشبینی صرفِ نقاط شروع و پایان، یک «توزیع احتمال مشترک» برای کل بازه زمانی تعریف میکند.
این مدل با نگاشت هر بازه به یک فضای دوبعدی (موقعیت-مدت زمان)، اجازه میدهد هوش مصنوعی بفهمد که چه زمانی یک رویداد واقعاً شروع شده و پایان مییابد؛ اتفاقی که دقت مدلها را در تحلیل دقیق ویدیوها و دستورات متنی کاربر به شدت افزایش میدهد.
این دستاورد میتواند آینده جستجوی پیشرفته در ویدیوها و ویرایش خودکار آنها را دگرگون کند. 🚀
منبع: arXiv Computer Vision
