مدلهای فعلی تبدیل متن به تصویر (Text-to-Image) در نمایش دقیق اشیاء متعدد در صحنههای شلوغ و همپوشان مشکل دارند و اغلب آنها را با هم ترکیب میکنند.
محققان با معرفی روش جدیدی به نام «AIBL» و ارائه دیتاسِت اختصاصی «OverlapDepth-45K»، موفق شدند این مشکل را با استفاده از «بایاسهای توجه آگاه به چیدمان» (Layout-aware attention) برطرف کنند. این تکنیک باعث میشود هوش مصنوعی حتی در صحنههای شلوغ و دارای همپوشانی، اشیاء را بهصورت دقیق و مجزا تشخیص دهد و از ترکیب شدن ناخواسته آنها جلوگیری کند.
این پیشرفت گام بزرگی برای افزایش دقت در مدلهای تولید تصویرِ واقعگرایانه است. 🚀
منبع: arXiv Computer Vision
