🧠 HiPO: جهش جدید در دقت پاسخ‌دهی مدل‌های زبانی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا مدل‌های زبانی در حل مسائل پیچیده و ریاضی هنوز هم دچار اشتباه می‌شوند؟ تحقیقات جدید نشان می‌دهد روش محبوب DPO برای آموزش مدل‌ها در تحلیل‌های چندمرحله‌ای ضعف دارد.

محققان تکنیک جدیدی به نام HiPO (Hierarchical Preference Optimization) معرفی کرده‌اند که با خرد کردن پاسخ‌های مدل به بخش‌های کوچک‌تر (منطق، تحلیل و جواب نهایی)، اجازه می‌دهد هوش مصنوعی روی هر بخش به‌صورت جداگانه آموزش ببیند. نتیجه؟ مدل‌های ۷ میلیاردی که با این روش آموزش دیده‌اند، در بنچمارک‌های ریاضی دقت بسیار بالاتری نسبت به روش‌های سنتی دارند و خروجی‌های بسیار منسجم‌تری ارائه می‌دهند. 🚀

این یعنی هوش مصنوعی در مسیر یادگیری منطقِ استدلالی، قدم‌های دقیق‌تری برمی‌دارد!

منبع: arXiv AI