🚀 جهشی بزرگ در حافظه مدل‌های ویدیویی هوش مصنوعی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی از مدل «WorldPack» رونمایی کردند که یک چالش اساسی در دنیای مدل‌های جهان‌بین (World Models) یعنی «حافظه طولانی‌مدت» را هدف قرار داده است.

💡 این فناوری چطور کار می‌کند؟
به جای استفاده از روش‌های قدیمی برای فشرده‌سازی فریم‌های ویدیویی، WorldPack با درک فضای سه‌بعدی و هوشمندی در انتخاب فریم‌های مهم (بر اساس موقعیت دوربین)، اجازه می‌دهد تا مدل‌های ویدیویی حجم بسیار بیشتری از تاریخچه بصری را در حافظه خود نگه دارند. نتیجه این کار، افزایش توانایی مدل از ۴ به ۲۲ فریمِ موثر در متن‌ (Context) است که دقت و ثبات تولید ویدیو را به شدت افزایش می‌دهد.

این پیشرفت می‌تواند راه را برای ساخت ایجنت‌های هوشمند با درک بسیار دقیق‌تر از محیط پیرامونشان هموار کند. دنیای هوش مصنوعی روز به روز واقعی‌تر می‌شود! 🎥✨

منبع: arXiv Machine Learning