تا امروز برای کارهایی مثل تخمین عمق یا جداسازی اشیاء (Segmentation)، مدلهای تولید تصویر را مجبور میکردیم خروجیهای غیرضروری تولید کنند، اما محققان در مقالهی جدیدی متد جذابی به نام ReChannel معرفی کردهاند.
این روش با تغییر ساختار در مدلهای DiT (مانند FLUX)، به جای تولید پیکسلهای RGB، مستقیماً «اطلاعات عددی» مورد نیاز برای کارهای تخصصی (مثل عمق یا جزئیات نقشه) را از همان پچهای تصویر استخراج میکند. نتیجه؟ سرعت بالاتر، دقت بسیار بیشتر و عبور از استانداردهای فعلی در کارهای بصری بدون نیاز به پردازشهای سنگین اضافی!
این یعنی هوش مصنوعی در درک محیط اطرافش یک قدم بزرگ به واقعیت نزدیکتر شده است. ✨
منبع: arXiv Computer Vision
