محققان در یک پژوهش جدید، تکنیک نوآورانهای به نام «HDPO» را معرفی کردهاند که به مدلهای زبانی کمک میکند در حل مسائل پیچیده، دقیقتر و خلاقتر عمل کنند.
🔹 ماجرا چیست؟
روشهای فعلی تقویت یادگیری (RLVR) معمولاً فقط روی «نتیجه نهایی» تمرکز دارند. اما روش HDPO از انسان الگو میگیرد؛ یعنی مدل ابتدا چندین راهکار مختلف (Hint) را پیشنهاد داده، آنها را بررسی میکند و در نهایت قابلاعتمادترین مسیر را برای رسیدن به پاسخ نهایی انتخاب میکند.
این رویکرد سهمرحلهای که با عنوان «پیشنهاد-انتخاب-تفکر» شناخته میشود، باعث شده مدلهای زبانی نه تنها در استدلال قویتر شوند، بلکه تنوع پاسخهایشان نیز افزایش چشمگیری داشته باشد.
این یعنی در آیندهای نزدیک، هوش مصنوعی در حل مسائل منطقی و علمی به شکلی بسیار هوشمندانهتر و انسانیتر عمل خواهد کرد! 🤖✨
منبع: arXiv NLP
