تا امروز فکر میکردیم برای داشتن یک مدل مولد قدرتمند مثل diffusion، حتماً باید فرآیندهای طولانی و چندمرحلهای (iterative denoising) را طی کنیم. اما پژوهش جدیدی با رویکرد «مینیمالیستی» این باور را به چالش کشیده است! 🔥
محققان با استفاده از روش Implicit Maximum Likelihood Estimation (IMLE) و یک شبکه کانولوشنی ساده، مدلی ساختهاند که بدون نیاز به پیچیدگیهای ترنسفورمرها یا یادگیریهای چندمرحلهای، در یک گام (Single-Step) تصاویری با کیفیت فوقالعاده روی ImageNet تولید میکند. این یعنی سرعت بسیار بالاتر و بهرهوری بیشتر در تولید محتوای هوشمند! ⚡️🧠
منبع: arXiv Computer Vision
