محققان مدل جدیدی به نام «NEXT» معرفی کردهاند که فراتر از توصیههای ساده و قدیمی عمل میکند. این مدل با ترکیب قابلیتهای بینایی-زبانی (Vision-Language)، نه تنها ویدیوهای قبلی شما را تحلیل میکند، بلکه با درک «قصد» شما، دقیقترین ویدیوهای بعدی را پیشنهاد میدهد.
ویژگیهای کلیدی NEXT:
🔹 استفاده از مدل 8 میلیاردی (8B) برای درک بصری عمیق
🔹 استراتژی «مورد به نیت به مورد» برای پیشنهادهای هوشمندانه
🔹 بهبود محسوس در میزان تماشای ویدیو (Watch Time) در سیستمهای واقعی
این یعنی در آینده نزدیک، فیدهای شبکههای اجتماعی برای ما بسیار شخصیسازیشدهتر و منطقیتر خواهند بود. 🚀
منبع: arXiv Computer Vision
