محققان در مقاله جدیدی، رویکرد متفاوتی را برای یادگیری ویدیوها معرفی کردهاند. برخلاف روشهای فعلی که به شدت وابسته به دادههای عظیم تصویری و متنی (کپشنها) هستند، این مدل جدید با تمرکز بر «حرکت» (Motion) و استفاده از پوینت-ترکها (point-tracks)، یادگیری را بهینهتر کرده است.
این متد که آن را TIME (Temporally Informed Motion Embedding) نامیدهاند، به هوش مصنوعی کمک میکند تا:
✅ با دادههای بسیار کمتر، تحلیلهای دقیقتری ارائه دهد.
✅ وابستگی به توصیفات متنی را کنار بگذارد.
✅ مفاهیم بصری دقیقتری را درک کند.
این یعنی در آیندهای نزدیک، ویدیوهای هوش مصنوعی میتوانند حرکات را بسیار واقعیتر و هوشمندانهتر از قبل درک کنند! 🚀
منبع: arXiv AI
