محققان در مطالعهای جدید، مدل قدرتمند G2TAM (Geometry Grounded Tracking Anything Model) را معرفی کردند که دنیای ردیابی اشیاء را متحول میکند!
این مدل برخلاف روشهای قدیمی که فقط بر ظاهر اشیاء تکیه داشتند، از «هندسه سهبعدی» برای درک بهتر محیط استفاده میکند. نتیجه این کار چیست؟
✅ ردیابی دقیقتر حتی در صورت تغییر زاویه دید یا پنهان شدن موقت اشیاء
✅ سازگاری بالا برای بازسازی سهبعدی و بخشبندی ویدئویی
✅ عملکرد عالی با استفاده از تصاویر RGB ساده
این دستاورد یک گام بزرگ به سمت هوش مصنوعی با درک فضایی انسانی است که میتواند در رباتیک و واقعیت افزوده کاربردهای فوقالعادهای داشته باشد. 🤖✨
بعدی
منبع: arXiv Computer Vision
