محققان در مقاله جدیدی، روش خلاقانهای به نام «TMI» معرفی کردهاند که دنیای «بخشبندی تصاویر» (Instance Segmentation) را متحول میکند.
مشکل اصلی مدلهای فعلی، ناتوانی در شناسایی دقیق اشیاء کمیاب و کیفیت پایین تصاویر تولید شده است. مدل TMI با ترکیب دو روش «تولید متن به تصویر» (T2I) و «ویرایش تصویر به تصویر» (I2I)، کیفیت تشخیص اشیاء را بهطور چشمگیری بهبود بخشیده است.
ویژگی کلیدی این مدل، بخش جدیدی به نام VRAIN است که با هوشمندی کامل، اشیاءِ هدف را در جای مناسب تصاویر قرار میدهد تا مدل بتواند روی دستههای کمیاب، آموزش دقیقتری ببیند. نتیجه؟ افزایش چشمگیر دقت (AP) در بنچمارکهای سختگیرانه!
منبع: arXiv Computer Vision
