محققان در مقاله جدیدی به بررسی ساختار درونی مدلهای دیفیوژن (DiTs) پرداختند و متوجه شدند که «فعالسازیهای عظیم» (Massive Activations) نقش کلیدی در جزئیات بصری دارند.
آنها متد جدیدی به نام EMA را معرفی کردهاند که بدون نیاز به آموزش مجدد، کیفیت تولید تصویر و توانمندی مدلهای هوش مصنوعی در درک محتوا را به شکل چشمگیری افزایش میدهد. این روش با دستکاری دقیق این فعالسازیها، به مدل کمک میکند جزئیات دقیقتری را سنتز کرده و خروجیهای بسیار باکیفیتتری ارائه دهد. ✨
منبع: arXiv Computer Vision
