یکی از چالشهای اصلی در تولید ویدیو با هوش مصنوعی (Text-to-Video)، حفظ تعادل بین «واقعگرایی فیزیکی» و «وفاداری به متن» است. اغلب مدلها وقتی سعی میکنند حرکتها را طبیعیتر کنند، از دستور اصلی کاربر فاصله میگیرند.
محققان در مقاله جدیدی روش هوشمندانه «PSDPO» را معرفی کردهاند که بدون نیاز به مدلهای جانبی، با بهینهسازی دقیق در طول فرآیند آموزش، به مدل یاد میدهد همزمان هم قوانین فیزیک را رعایت کند و هم دقیقاً همان چیزی را بسازد که شما خواستهاید. این دستاورد باعث شده کیفیت و منطق ویدیوهای تولیدی تا ۲ برابر بهبود یابد! 🚀
منبع: arXiv Computer Vision
