تا به حال فکر کردید که عاملهای هوش مصنوعی (LLM Agents) چطور کنترل میشوند؟ معمولاً ما روی مدل یا پرامپتها تمرکز میکنیم، اما محققان در یک مقاله جدید، سراغ «زیرساخت اجرا» (Harness) رفتند.
💡 نکته کلیدی این تحقیق این است که به جای ثابت در نظر گرفتنِ محیط اجرای عامل، آن را به عنوان یک لایه کنترلی «یادگیرنده» تعریف کردهاند. با استفاده از روش یادگیری تقویتی آفلاین (Offline Reinforcement Learning)، این عاملها یاد میگیرند که چطور فرآیند اجرای وظایف خود را بهینهتر کنند، بدون اینکه نیاز باشد خودِ مدلِ زبانی تغییر کند.
نتیجه؟ بهبود عملکرد در حل مسائل پیچیده، برنامهنویسی و تستهای استانداردی مثل AgentBench. این یعنی یک قدم دیگر به سمت عاملهای هوشمند و خودمختارِ قابلاعتمادتر نزدیک شدیم.
منبع: arXiv AI
