حتماً برای شما هم پیش آمده که از یک مدل تولید تصویر (Text-to-Image) خواستهاید صحنهای با چندین جزئیات مختلف خلق کند، اما هوش مصنوعی در نهایت برخی از المانها را فراموش کرده یا ترکیب آنها را به هم ریخته است. این مشکلِ «تولید ترکیبی»، یکی از چالشهای بزرگ در دنیای AI است.
محققان در پژوهش جدید خود روشی به نام CMO (Correlation-Weighted Multi-Reward Optimization) را معرفی کردهاند. این تکنیک هوشمند با تحلیلِ ارتباط بین ویژگیهای مختلفِ موجود در پرامپت شما، به مدل کمک میکند تا به جای سردرگمی، روی مفاهیمِ سخت و متناقض تمرکز بیشتری داشته باشد.
به زبان ساده: CMO به مدل یاد میدهد چطور وزنِ اهمیت هر بخش از درخواست شما را تنظیم کند تا نتیجهی نهایی، دقیقاً همان چیزی باشد که در ذهن داشتید. گامی مهم برای رسیدن به تصاویرِ بینقص!
منبع: arXiv AI
