آیا تا به حال فکر کردهاید که چه چیزی یک «ایجنت» (Agent) هوش مصنوعی را در محیطهای واقعی قابل اعتماد میکند؟ در یک مقاله جدید، محققان سیستم Leni را بررسی کردهاند تا ببینند چرا ایجنتهای سازمانی در کارهای چندمرحلهای شکست میخورند و چطور میتوان این مشکل را حل کرد.
نکات کلیدی این پژوهش:
✅ حلقههای تایید: استفاده از مدلهای تخصصی و کوچک برای نظارت بر خروجیها.
✅ نقش حیاتی زیرساخت: برخلاف تصور، بخش اصلی بهبود عملکرد (Up-lift) نه فقط از تایید نهایی، بلکه از مسیریابی درست و طراحی ساختار (Scaffolding) به دست میآید.
✅ نتایج چشمگیر: سیستم مورد بررسی توانسته دقت خود را در بنچمارکهای سختی مثل GAIA تا ۱۵ درصد افزایش دهد.
این تحقیق نشان میدهد که برای ساخت ایجنتهای واقعاً کاربردی، باید فراتر از مدلهای پایه فکر کرد و روی معماریهای نظارتی تمرکز داشت.
نویسی
منبع: arXiv AI
