تا به حال دقت کردهاید که مدلهای هوش مصنوعی وقتی میخواهند یک ویدیوی طولانی تولید کنند، گاهی وقتی دوربین به یک محیط قبلی برمیگردد، همه چیز تغییر میکند؟ (مثلاً اشیاء غیب میشوند یا ظاهرشان عوض میشود).
محققان در مقاله جدیدی روشی به نام «Closing the Loop» معرفی کردهاند که بدون نیاز به آموزش مجدد (Training-Free)، این مشکل را حل میکند. این مدل با استفاده از اطلاعات هندسی و تطبیق دادههای زمانی، حافظه کوتاهمدت مدل را مدیریت میکند تا وقتی دوربین به نقطهای بازمیگردد، جزئیات محیط دقیقاً مشابه قبل رندر شود. این یک گام بزرگ برای ساخت بازیهای ویدئویی واقعگرایانه و محیطهای مجازی در آینده است! 🎮🧠
منبع: arXiv Computer Vision
