مدلهای زبانی بزرگ با وجود هوش بالایی که دارن، گاهی در رعایت قوانین و محدودیتهای خاص حین برنامهریزی (Planning) دچار اشتباه میشن. محققان برای رفع این مشکل، چارچوب جدیدی به نام CARL (Constraint-Aware Reinforcement Learning) معرفی کردن.
این متد با استفاده از یادگیری تقویتی، به مدل کمک میکنه تا به جای تکیه بر ابزارهای خارجی، ذاتا نسبت به «محدودیتها» آگاه بشه. تستها روی پروژههای پیچیدهای مثل TravelPlanner نشون داده که CARL عملکرد بسیار بهتری نسبت به روشهای سنتی داره و برنامهریزیهای دقیقتری ارائه میده. قدمی تازه برای رسیدن به هوش مصنوعیِ قابلاعتمادتر! 🤖✨
منبع: arXiv AI
