تا به حال برایتان پیش آمده که بخواهید در مدلهای تولید تصویر (مثل Stable Diffusion)، چندین سوژه یا کاراکتر مختلف را همزمان و بدون بهم ریختگیِ جزئیات در یک صحنه قرار دهید؟ معمولاً مدلها در این کار دچار سردرگمی میشوند و هویت سوژهها با هم ترکیب میشود.
محققان در مقاله جدیدی، چارچوب هوشمند «LILAC» را معرفی کردهاند. این روش به جای ترکیبِ آداپتورهای سنگین (LoRA) در یک فضای وزنی مشترک، آنها را به صورت لایهبندی و مرحلهبهمرحله روی هم سوار میکند. نتیجه؟ حفظ دقیق هویت هر سوژه بدون تداخل پارامتری و بدون نیاز به آموزش مجدد!
💡 این یعنی آزادی عمل بیشتر برای طراحان و هنرمندان دیجیتال که میخواهند سناریوهای پیچیدهتر با چندین سوژه خاص را با کیفیت بالا به تصویر بکشند.
🔗 کد پروژه: https://github.com/marianlupascu/LILAC
منبع: arXiv Computer Vision
