مدلهای چندوجهی (Multimodal LLMs) تا امروز در درک تغییرات زمانی و توالیهای ویدیویی با چالشهای زیادی روبرو بودند. اما محققان مدل جدیدی به نام DynaVieW را معرفی کردهاند که دنیای شبیهسازی بصری را متحول میکند.
این مدل با استفاده از یک معماری «ترکیب متخصصان» (Mixture-of-Experts)، یاد میگیرد که چطور توالیهای انتقال حالت را درک کند و تغییرات پیچیده در محیطهای بصری را دقیقتر از همیشه شبیهسازی کند. خروجی این مدل، بهبود چشمگیر در روایتهای ویدیویی، حفظ ثبات در سناریوهای طولانی و اجرای بهتر دستورات کاربر است.
این یعنی در آیندهای نزدیک، ویدیوهایی که توسط هوش مصنوعی ساخته میشوند، بسیار واقعیتر و با کنترلپذیری بسیار بالاتری همراه خواهند بود. 🤖✨
های_چندوجهی سازی
منبع: arXiv AI
