محققان در یک پژوهش جدید، راهکاری نوآورانه برای درک حرکتهای سهبعدی در سیستمهای «بینایی دوچشمی» (Binocular Vision) ارائه دادند.
این تیم با الهام از تئوری کنترل PID (که در مهندسی کلاسیک بسیار رایج است)، یک شبکه عصبی کانولوشنی (CNN) بسیار بهینه با ۱۷ لایه و تنها ۴۱۳ هزار پارامتر طراحی کردهاند. این مدل نه تنها مختصات دقیق، بلکه سرعت و شتاب هدف را هم به صورت لحظهای تشخیص میدهد.
ویژگی کلیدی این مدل، ترکیب هوشمندانه مفاهیم کنترلی با معماریهای عمیق است که باعث شده دقت پیشبینی حرکت به حداکثر ظرفیت رزولوشن تصاویر برسد. دستاوردی جذاب که میتواند مسیر تازهای برای پردازشهای بصریِ کمحجم و سریع در رباتیک و پهپادها باز کند! 🤖✨
منبع: arXiv AI
