آیا تا به حال دقت کردید که مدلهای تبدیل متن به تصویر (T2I) گاهی اوقات خیلی محدود عمل میکنند و تنوع خروجیها پایین است؟ محققان در یک مقاله جدید، راهکار هوشمندانهای به نام “Multi-Axis Max@K” معرفی کردند.
این روشِ مبتنی بر یادگیری تقویتی (Reinforcement Learning)، به مدل کمک میکند تا هنگام تولید تصویر، طیف وسیعتری از حالتهای مختلف را پوشش دهد. این یعنی نه تنها کیفیت تصویر حفظ میشود، بلکه «تنوع» و «عدالت» در بازنمایی (مثلاً در تصاویر انسانی) به شدت بهبود مییابد. 📊✨
این دستاورد کمک میکند تا هوش مصنوعی خروجیهای خلاقانهتر و منصفانهتری تولید کند.
منبع: arXiv Computer Vision
