محققان در یک پژوهش جدید، راهکار جذابی برای حل چالشهای تولید ویدیو توسط مدلهای دیفیوژن ارائه کردهاند. مدل PE-Field 4D با استفاده از یک مکانیسم جدید در «کدگذاری موقعیتی» (Positional Encoding)، به هوش مصنوعی کمک میکند تا هندسه صحنه و حرکات دوربین را بسیار دقیقتر از قبل درک و کنترل کند. 📐✨
این مدل با برقراری ارتباط دقیق بین فریمهای مرجع و مسیر حرکت دوربین، به کاربر اجازه میدهد تا ویرایشهای ویدیویی، از جمله تغییر مسیر حرکت دوربین یا دیدگاههای جدید را با ثبات بصری فوقالعاده انجام دهد. این یعنی گامی بزرگ به سوی تولید ویدیوهای شخصیسازیشده و حرفهایتر! 🎞️💡
منبع: arXiv Computer Vision
