محققان در مقاله جدیدی، رویکرد نوآورانهای برای بهینهسازی مدلهای زبانی دیفیوژن ارائه کردهاند. تا پیش از این، استفاده از یادگیری تقویتی در این مدلها به دلیل دشواری در تخمین احتمالات، با چالشهای جدی روبرو بود.
این روش جدید که با نام «Mask-Aware Policy Gradients» معرفی شده، فرآیند تولید توکنها و نحوه ماسکگذاری آنها را به صورت هوشمندانه بازتعریف میکند. نتیجه این بهینهسازی، رسیدن به نتایج خیرهکننده در بنچمارکهای استدلالی و کدنویسی (مانند دقت ۸۷.۱٪ در GSM8K) بوده است. این دستاورد میتواند راه را برای هوش مصنوعیهای سریعتر و دقیقتر در حل مسائل منطقی هموارتر کند. 🧠💻
منبع: arXiv Machine Learning
