حتماً متوجه شدید که گاهی هوش مصنوعی خیلی با اعتمادبهنفس حرف میزند اما منطق جوابش ایراد دارد! محققان به تازگی سیستم جدیدی به نام RLearner-LLM معرفی کردهاند که این مشکل را حل میکند.
مشکل اصلی اکثر مدلهای فعلی این است که در فرآیند یادگیری، به جای «درست بودن»، بیشتر به «روان بودن و پرحرفی» پاداش میدهند. این روش جدید (Hybrid-DPO) با ترکیب سیگنالهای منطقی، هوش مصنوعی را مجبور میکند به جای حاشیه رفتن، بر «صحت منطقی» تمرکز کند. نتیجه کار؟ مدلی که در حوزههای تخصصی مثل پزشکی و حقوق، بسیار دقیقتر و منطقیتر از قبل پاسخ میدهد.
این پیشرفت گام بزرگی برای کاهش خطاهای منطقی (Hallucinations) در مدلهای زبانی است.
منبع: arXiv AI
