محققان در تازهترین دستاورد خود، مدل «Hierarchical Slot Attention» یا همان HSA را معرفی کردهاند که نحوه دیدن و تحلیل محیط توسط هوش مصنوعی را متحول میکند.
مدلهای فعلی معمولاً تصاویر را به صورت تخت و یکپارچه تحلیل میکنند، اما HSA با الهام از قدرت ادراک انسان، صحنهها را به صورت سلسلهمراتبی تجزیه میکند:
۱. تشخیص زمینه و پیشزمینه (Holistic)
۲. دستهبندی اشیاء (Semantic)
۳. شناسایی تکتک اجزا (Panoptic)
این مدل با نیاز به تنها ۱۰٪ دادههای برچسبگذاری شده، توانسته رکوردهای قبلی در دقت شناسایی تصاویر (در مجموعههای COCO و PASCAL VOC) را تا حد چشمگیری جابهجا کند. این یعنی قدمی بزرگ به سمت رباتهایی که دنیا را مثل ما «دقیقتر» و «لایهای» میبینند! 🤖✨
منبع: arXiv Computer Vision
