محققان در مقاله جدیدی از مدل «WorldPack» رونمایی کردند که یک چالش اساسی در دنیای مدلهای جهانبین (World Models) یعنی «حافظه طولانیمدت» را هدف قرار داده است.
💡 این فناوری چطور کار میکند؟
به جای استفاده از روشهای قدیمی برای فشردهسازی فریمهای ویدیویی، WorldPack با درک فضای سهبعدی و هوشمندی در انتخاب فریمهای مهم (بر اساس موقعیت دوربین)، اجازه میدهد تا مدلهای ویدیویی حجم بسیار بیشتری از تاریخچه بصری را در حافظه خود نگه دارند. نتیجه این کار، افزایش توانایی مدل از ۴ به ۲۲ فریمِ موثر در متن (Context) است که دقت و ثبات تولید ویدیو را به شدت افزایش میدهد.
این پیشرفت میتواند راه را برای ساخت ایجنتهای هوشمند با درک بسیار دقیقتر از محیط پیرامونشان هموار کند. دنیای هوش مصنوعی روز به روز واقعیتر میشود! 🎥✨
منبع: arXiv Machine Learning
