یکی از مشکلات رایج در مدلهای تبدیل متن به تصویر (مثل SDXL)، عدم دقت در چیدمان اشیاء و ترکیب ویژگیهای آنهاست. حالا محققان ماژول جدیدی به نام «MaskAttn-SDXL» معرفی کردهاند که بدون نیاز به آموزش مجدد مدل اصلی، اجازه میدهد کنترل بسیار دقیقتری بر روی نواحی خاص تصویر داشته باشیم.
این افزونه با استفاده از «گیتینگ فضایی شرطی»، تداخل بین ویژگیهای اشیاء مختلف را حذف کرده و دقت مدل را در چیدمان اجزا به طرز چشمگیری بالا میبرد. خبر خوب اینکه این روش نیاز به سختافزار بسیار سنگین هم ندارد و به راحتی روی خط لوله فعلی SDXL نصب میشود.
منبع: arXiv Computer Vision
