یک بحث چالشبرانگیز در دنیای یادگیری ماشین این است که آیا مدلهای بینایی برای رسیدن به بهرهوری انسانی، حتماً باید «مولد» (Generative) باشند یا میتوانند صرفاً «رمزگذار» (Encoder-based) باقی بمانند؟
پژوهش جدیدی که اخیراً منتشر شده، نشان میدهد که استفاده از مدلهای مولد (Decoder-based) میتواند «تعمیم ترکیباتی» (Compositional Generalization) را بسیار آسانتر کند. در واقع، این تحقیق استدلال میکند که سوگیریهای استقرایی در مدلهای مولد سادهتر و عملیتر از مدلهای صرفاً تحلیلی هستند. این یافته میتواند مسیر توسعه مدلهای بیناییِ هوشمندتر و کارآمدتر را تغییر دهد! 🚀
منبع: arXiv Computer Vision
