تولید تصویر با ترکیب چند مرجع (Multi-Reference) همیشه یکی از چالشهای هوش مصنوعی بوده؛ مدلها اغلب در درک درست ویژگیها و چیدمان آنها گیج میشوند. اما حالا محققان با معرفی مدل جدید StructGen، راهکار جذابی پیدا کردهاند.
این سیستم به جای اتکا به دستورات متنی طولانی که اغلب مبهم هستند، از یک فرمت ساختاریافته و دیکشنریمانند برای مدیریت تصاویر استفاده میکند. نتیجه؟ دقت خیرهکننده در چیدمان و حفظ انسجامِ معنایی حتی در پیچیدهترین پروژهها! ✨
این دستاورد یک گام بزرگ برای کسانی است که به دنبال کنترل دقیقتر بر خروجیهای هوش مصنوعی هستند.
منبع: arXiv Computer Vision
