محققان در دستاورد جدیدی متوجه شدند که مدلهای بینایی (Vision Foundation Models) مانند DINOv3، بدون نیاز به آموزش تخصصی برای چهره، میتوانند اجزای صورت انسان مثل چشم، بینی و دهان را در افراد مختلف با دقت خیرهکنندهای شناسایی و ردیابی کنند. 🧠✨
این تحقیق نشان میدهد که این مدلها در لایههای میانی خود، یک سیستم مختصات درونی برای صورت دارند که باعث میشود درک دقیقتری از جزئیات آناتومیک نسبت به مدلهای قدیمی داشته باشند. این یعنی قدمی بزرگ به سوی بینایی ماشین دقیقتر که میتواند در تحلیلهای ویدئویی و بازشناسی چهره تحولی ایجاد کند. 🎯
منبع: arXiv Computer Vision
