🎬 جهش خیره‌کننده در تولید ویدئوهای واقع‌گرایانه با مدل VIPER

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا به حال برایتان پیش آمده که بخواهید ویدئویی تولید کنید اما فیزیک حرکت‌ها (مثل برخورد اجسام یا تغییر شکل مواد) مصنوعی به نظر برسد؟ محققان با معرفی فریم‌ورک جدید «VIPER» به سراغ حل این چالش رفته‌اند.

این مدل جدید به جای تکیه صرف بر متن یا تصویر، از یک ویدئوی مرجع به عنوان راهنمای فیزیکی استفاده می‌کند. به زبان ساده، VIPER با درک دقیق قوانین فیزیک از روی ویدئوی مرجع، می‌تواند حرکات و تعاملات اشیاء را در ویدئوی جدید با دقت بسیار بالا شبیه‌سازی کند.

ویژگی‌های کلیدی VIPER:
✅ استفاده از مدل‌های زبانی چندوجهی (MLLM) برای استخراج دقیقِ ویژگی‌های فیزیکی.
✅ بهبود چشمگیر در شبیه‌سازی برخورد، تغییر شکل و مسیر حرکت اجسام.
✅ معرفی مجموعه داده VIPER-19K برای آموزش بهتر مدل‌های ویدئویی.

این نوآوری راه را برای ساخت محتواهای ویدئویی که قوانین فیزیک دنیای واقعی را رعایت می‌کنند، بسیار هموارتر کرده است. نظر شما چیست؟ آیا هوش مصنوعی بالاخره می‌تواند ویدئوهایی تولید کند که از فیلم‌های واقعی قابل تشخیص نباشند؟

منبع: arXiv Computer Vision