محققان به تازگی مدل جدیدی به نام «Brain-Aligned Multi-Stream Video Transformer» معرفی کردهاند که فرآیند پردازش ویدیو در هوش مصنوعی را به عملکرد مغز پستانداران نزدیکتر میکند. 🧬
این مدل بهجای روشهای معمول، از دو مسیر مجزا استفاده میکند:
۱. مسیر «چیستی» (What): با رزولوشن بالا و نرخ فریم پایین.
۲. مسیر «کجایی» (Where): با رزولوشن پایین و نرخ فریم بالا.
نتیجه این طراحی، علاوه بر افزایش چشمگیر دقت و سرعت (بهرهوری بالاتر)، باعث شده تا الگوهای داخلی این مدل شباهت بسیار زیادی به فعالیت مغز انسان هنگام تماشای ویدیو داشته باشد. این یعنی هوش مصنوعی در حال یادگیریِ «دیدن» به روشی هوشمندانهتر و بیولوژیکتر است! 🚀
منبع: arXiv Machine Learning
