آیا مدلهای زبانی در حل مسائل پیچیده و ریاضی هنوز هم دچار اشتباه میشوند؟ تحقیقات جدید نشان میدهد روش محبوب DPO برای آموزش مدلها در تحلیلهای چندمرحلهای ضعف دارد.
محققان تکنیک جدیدی به نام HiPO (Hierarchical Preference Optimization) معرفی کردهاند که با خرد کردن پاسخهای مدل به بخشهای کوچکتر (منطق، تحلیل و جواب نهایی)، اجازه میدهد هوش مصنوعی روی هر بخش بهصورت جداگانه آموزش ببیند. نتیجه؟ مدلهای ۷ میلیاردی که با این روش آموزش دیدهاند، در بنچمارکهای ریاضی دقت بسیار بالاتری نسبت به روشهای سنتی دارند و خروجیهای بسیار منسجمتری ارائه میدهند. 🚀
این یعنی هوش مصنوعی در مسیر یادگیری منطقِ استدلالی، قدمهای دقیقتری برمیدارد!
منبع: arXiv AI
