محققان روش جدیدی به نام RubricRL ارائه دادهاند که کنترلِ خروجی مدلهای تبدیل متن به تصویر (Text-to-Image) را بسیار دقیقتر و هوشمندانهتر میکند.
تفاوت این روش در این است که به جای استفاده از یک امتیاز کلی و سیاه-جعبه، مدل بر اساس یک «چکلیست» دقیق از ویژگیها (مانند صحتِ اشیاء، جزئیات بصری، دقت متن و…) ارزیابی میشود. این یعنی:
✅ دقتِ بسیار بالاتر در رعایت جزئیاتِ پرامپتها.
✅ قابلیتِ تنظیم و شخصیسازی توسط کاربر (تعیین اینکه کدام بخش از تصویر اهمیت بیشتری دارد).
✅ تفسیرپذیریِ عالی؛ چون میدانیم چرا مدل یک تصویر را تولید کرده است.
این نوآوری راه را برای تولید تصاویر با کیفیتتر و حرفهایتر هموارتر میکند! 🚀
منبع: arXiv Computer Vision
