محققان در تازهترین دستاورد خود، روشی نوآورانه به نام «Structured Sparse Autoencoder» یا به اختصار S²AE معرفی کردهاند که تحولی در درک عملکرد مدلهای بینایی-زبانی (VLMs) ایجاد میکند.
❓ ماجرا چیست؟
مدلهای فعلی در درک مفاهیم بینایی و متن معمولاً دچار پراکندگی میشوند؛ یعنی مفاهیم در بخشهای مختلف تصویر به درستی به هم متصل نیستند. این متد جدید با استفاده از «ساختاربندی پیشفرض» و تمرکز روی شباهتهای توجه (Attention) در ترنسفورمرها، باعث میشود مدل مفاهیم را بهصورت منسجمتر و دقیقتر درک کند.
📈 دستاوردها:
✅ بهبود ۶ درصدی در همراستایی معنایی (mIoU)
✅ افزایش چشمگیر بهرهوری مدل
✅ حفظ دقت بازسازی تصاویر با بیش از ۹۹٪ اطمینان
این پیشرفت، راه را برای ساخت هوش مصنوعیهای شفافتر (Interpretability) و قابلاعتمادتر هموار میکند. نظر شما چیست؟ آیا هوش مصنوعی بالاخره مثل انسان «میبیند»؟
منبع: arXiv Computer Vision
