مدلهای تبدیل متن به تصویر (T2I) در کنار پیشرفتهای خیرهکنندهشان، هنوز هم وقتی با توصیفات پیچیده یا ترکیبات کمیاب اشیا روبرو میشوند، دچار سردرگمی شده و جزئیات را نادیده میگیرند.
محققان در مقاله جدیدی، چارچوب هوشمند «RADIANCE» را معرفی کردهاند که بدون نیاز به آموزش مجدد مدلهای قبلی، کیفیت تولید تصاویر ترکیبی را به شدت بهبود میبخشد. این سیستم مانند یک «حلقه بازخورد هوشمند» در طول فرآیند تولید تصویر عمل کرده و با نظارت دقیق بر نحوه شکلگیری اجزا، از وقوع خطاهای معنایی و حذف مفاهیم جلوگیری میکند.
با این روش جدید، تداخل مفاهیم در تصاویر چندموضعی کاهش یافته و دقت خروجی نهایی بهطور چشمگیری افزایش پیدا میکند. گامی دیگر برای واقعیتر شدن تصاویر هوش مصنوعی! 🖌️✨
منبع: arXiv Computer Vision
