تا به حال فکر کردهاید چرا مدلهای چندوجهی (UMM) برای تولید تصویر همچنان به ابزارهای جانبی مثل VAE وابسته هستند؟ محققان در یک پژوهش جدید، راهکاری به نام «Representation Forcing» یا به اختصار RF ارائه دادهاند که این محدودیت ساختاری را از بین میبرد.
💡 در این روش، مدل یاد میگیرد به جای تکیه بر رمزگذارهای خارجی، ابتدا بازنماییهای بصری را به صورت متنی پیشبینی کند. این کار باعث میشود مدل هم در درک محتوا و هم در تولید تصاویر باکیفیت، بسیار دقیقتر عمل کند و عملاً به یک مدل کاملاً یکپارچه و بدون گلوگاه تبدیل شود.
این پیشرفت گام بزرگی برای رسیدن به هوش مصنوعیهایی است که بدون نیاز به قطعات جانبی، همهچیز را «ذاتی» یاد میگیرند.
منبع: arXiv Computer Vision
