🎨 ترکیب چند سوژه در یک تصویر؛ معرفی متد خلاقانه LILAC برای شخصی‌سازی مدل‌های انتشار

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا به حال برایتان پیش آمده که بخواهید در مدل‌های تولید تصویر (مثل Stable Diffusion)، چندین سوژه یا کاراکتر مختلف را همزمان و بدون بهم ریختگیِ جزئیات در یک صحنه قرار دهید؟ معمولاً مدل‌ها در این کار دچار سردرگمی می‌شوند و هویت سوژه‌ها با هم ترکیب می‌شود.

محققان در مقاله جدیدی، چارچوب هوشمند «LILAC» را معرفی کرده‌اند. این روش به جای ترکیبِ آداپتورهای سنگین (LoRA) در یک فضای وزنی مشترک، آن‌ها را به صورت لایه‌بندی و مرحله‌به‌مرحله روی هم سوار می‌کند. نتیجه؟ حفظ دقیق هویت هر سوژه بدون تداخل پارامتری و بدون نیاز به آموزش مجدد!

💡 این یعنی آزادی عمل بیشتر برای طراحان و هنرمندان دیجیتال که می‌خواهند سناریوهای پیچیده‌تر با چندین سوژه خاص را با کیفیت بالا به تصویر بکشند.

🔗 کد پروژه: https://github.com/marianlupascu/LILAC

منبع: arXiv Computer Vision