تا به حال برایتان پیش آمده که بخواهید ویدئویی تولید کنید اما فیزیک حرکتها (مثل برخورد اجسام یا تغییر شکل مواد) مصنوعی به نظر برسد؟ محققان با معرفی فریمورک جدید «VIPER» به سراغ حل این چالش رفتهاند.
این مدل جدید به جای تکیه صرف بر متن یا تصویر، از یک ویدئوی مرجع به عنوان راهنمای فیزیکی استفاده میکند. به زبان ساده، VIPER با درک دقیق قوانین فیزیک از روی ویدئوی مرجع، میتواند حرکات و تعاملات اشیاء را در ویدئوی جدید با دقت بسیار بالا شبیهسازی کند.
ویژگیهای کلیدی VIPER:
✅ استفاده از مدلهای زبانی چندوجهی (MLLM) برای استخراج دقیقِ ویژگیهای فیزیکی.
✅ بهبود چشمگیر در شبیهسازی برخورد، تغییر شکل و مسیر حرکت اجسام.
✅ معرفی مجموعه داده VIPER-19K برای آموزش بهتر مدلهای ویدئویی.
این نوآوری راه را برای ساخت محتواهای ویدئویی که قوانین فیزیک دنیای واقعی را رعایت میکنند، بسیار هموارتر کرده است. نظر شما چیست؟ آیا هوش مصنوعی بالاخره میتواند ویدئوهایی تولید کند که از فیلمهای واقعی قابل تشخیص نباشند؟
منبع: arXiv Computer Vision
