محققان در یک پژوهش جدید، نقش «توکنهای رجیستر» (Register Tokens) را در مدلهای DiT (مدلهای انتشار مبتنی بر ترنسفورمر) بررسی کردند. برخلاف Vision Transformerها که از این توکنها برای رفع خطاهای دادههای پرت استفاده میکنند، در مدلهای انتشار، این توکنها به تولید نقشههای ویژگی (Feature Maps) با کیفیتتر و منسجمتر کمک میکنند.
نتایج این تحقیق نشان میدهد که استفاده از تکنیک جدیدی به نام «Register Guidance» میتواند به طرز چشمگیری باعث بهبود ساختار بصری و کیفیت تولید تصاویر در مدلهای pixel-space شود. این قدم مهمی برای افزایش دقت و کارایی مدلهای تولید تصویر در آینده است! 🎨✨
های_انتشار
منبع: arXiv Computer Vision
