محققان با معرفی Wan-Streamer v0.3، مدل مفهومی جدیدی ارائه دادهاند که ویدیو را ترکیبی از یک «جهان ثابت» و یک «جریان رویداد» میبیند. این یعنی هوش مصنوعی حالا میتواند محیط و شرایط پایدار را از اتفاقات لحظهای (مثل حرکت، صدا و رفتار سوژهها) تفکیک کند.
ویژگیهای کلیدی این مدل:
✅ درک همزمان تصویر، متن و عمل (Action)
✅ زمان پاسخدهی بسیار سریع (حدود ۲۰۰ میلیثانیه)
✅ بهینهشده برای تعاملات صوتی-تصویری دوطرفه و زنده
این پیشرفت میتواند مسیر را برای دستیابی به ایجنتهای هوشمند با واکنشهای انسانیتر و سریعتر در دنیای واقعی هموار کند. دنیای مدلهای مولد ویدیو با سرعت خیرهکنندهای در حال تکامل است! ⚡️
منبع: arXiv Computer Vision
