مدلهای تولید تصویر (Flow Matching) با یک چالش بزرگ در فرآیند یادگیری روبرو هستند: پاداشهای «پراکنده» که باعث میشود مدل نتواند دقیقاً درک کند کدام مرحله از نویززدایی به نتیجه نهایی کمک کرده است. 🎨
محققان برای حل این مشکل، فریمورک «TP-GRPO» را معرفی کردهاند که دو نوآوری کلیدی دارد:
1️⃣ جایگزینی پاداشهای کلی با پاداشهای مرحلهبهمرحله (Incremental Rewards) تا هر حرکت مدل در فرآیند تولید به دقت تحلیل شود.
2️⃣ شناسایی «نقاط عطف» در طول مسیر تولید، تا اثرات بلندمدت هر مرحله بهدرستی محاسبه شود.
این روش نه تنها دقت و کیفیت خروجی مدلها را بهبود میبخشد، بلکه بدون نیاز به پارامترهای پیچیده، بسیار بهینه عمل میکند. برای دسترسی به کد این تحقیق میتوانید به گیتهاب پروژه سر بزنید.
منبع: arXiv Computer Vision
