مدلهای تولید تصویر (T2I) روز به روز پیشرفتهتر میشوند، اما هنوز هم در درک ظرافتهای فرهنگی و واقعگرایی در نمایش فرهنگهای مختلف ضعف دارند. محققان به تازگی مدل جدیدی به نام Implicit Cultural Alignment معرفی کردهاند که با استفاده از مکانیسم نوآورانه «SkipCA»، به مدلهای زبانی-تصویری کمک میکند تا جزئیات فرهنگی را بسیار دقیقتر درک کنند.
این مدل برخلاف روشهای قبلی که کند بودند، با حذف تولید متن خودبازگشت، عملیات ارزیابی را در کمتر از یکچهارم ثانیه انجام میدهد که جهشی بزرگ در دقت و سرعتِ ارزیابیِ عدالت در مدلهای هوش مصنوعی محسوب میشود.
منبع: arXiv AI
