🎨 حل مشکل «درهم‌تنیدگی اشیاء» در مدل‌های تولید تصویر

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های فعلی تبدیل متن به تصویر (Text-to-Image) در نمایش دقیق اشیاء متعدد در صحنه‌های شلوغ و همپوشان مشکل دارند و اغلب آن‌ها را با هم ترکیب می‌کنند.

محققان با معرفی روش جدیدی به نام «AIBL» و ارائه دیتاسِت اختصاصی «OverlapDepth-45K»، موفق شدند این مشکل را با استفاده از «بایاس‌های توجه آگاه به چیدمان» (Layout-aware attention) برطرف کنند. این تکنیک باعث می‌شود هوش مصنوعی حتی در صحنه‌های شلوغ و دارای هم‌پوشانی، اشیاء را به‌صورت دقیق و مجزا تشخیص دهد و از ترکیب شدن ناخواسته آن‌ها جلوگیری کند.

این پیشرفت گام بزرگی برای افزایش دقت در مدل‌های تولید تصویرِ واقع‌گرایانه است. 🚀

منبع: arXiv Computer Vision