تا به حال درباره «مهندسی پرامپت» برای مدلهای زبانی شنیدهاید؟ حالا محققان روش مشابهی را برای مدلهای ویدیویی معرفی کردهاند به نام VIPE!
در این روش، به جای تغییر متن، خودِ «تصویر» یا «فریمهای ویدیویی» به شکلی بهینه تغییر داده میشوند تا مدل بتواند استدلال بصری قویتری داشته باشد. برای مثال، تبدیل یک طرح ساده به یک تصویر واقعگرایانه با کمک هوش مصنوعی، عملکرد مدل در درک فیزیک یا تحلیل صحنه را به طرز چشمگیری افزایش میدهد.
این تحقیق نشان میدهد که گاهی اوقات یک تغییر کوچک در ورودی بصری، از هر نوع بهینهسازی متنی برای مدلهای ویدیویی موثرتر است! 🚀
منبع: arXiv AI
