مدلهای زبانی مبتنی بر انتشار (Diffusion LLMs) که متن را به جای روشهای سنتی، با حذف نویز تولید میکنند، پتانسیل زیادی دارند اما همیشه در بحث «استدلال» ضعفهایی داشتند.
محققان حالا با معرفی روش dOPSD (تقطیر خودکار روی خط مشی)، این مشکل را حل کردهاند. در این روش، مدل به جای تکیه بر اطلاعات خارجی یا برچسبهای انسانی، از مسیرِ حدسهای قبلی خودش برای یادگیری بهتر استفاده میکند. نتیجه؟ بهبود خیرهکننده در حل مسائل ریاضی و تولید کدهای برنامهنویسی!
این نوآوری نشان میدهد که هوش مصنوعی چطور میتواند با بازنگری در فرآیند تولید خروجیهای خودش، دقیقتر و منطقیتر عمل کند. 🚀
منبع: arXiv AI
